Define qué significa completar bien la tarea
Describe el resultado esperado y las acciones autorizadas. Un agente que prepara una propuesta de reunión tiene un alcance distinto de otro que confirma la reserva. El primero puede aprobar una prueba sin haber modificado el calendario; el segundo necesita demostrar que actuó sobre la fecha y las personas correctas.
Especifica también cuándo debe detenerse, solicitar datos o trasladar el caso a una persona. La documentación de evaluación de OpenAI recomienda pruebas adaptadas a la tarea y combinar medidas automáticas con criterio humano. La guía de NIST añade la necesidad de considerar el contexto y los efectos del sistema.
Prepara casos que puedan revelar fallos
Empieza con entradas ficticias que representen el trabajo previsto. Conserva un conjunto de comprobación que no utilices para ajustar cada cambio. Separa los casos por tipo para que un promedio favorable no oculte un fallo relevante en una categoría.
- Casos habituales con información completa y una salida esperada clara.
- Solicitudes ambiguas o incompletas que necesitan una pregunta de aclaración.
- Acciones fuera del alcance permitido y acceso a información de otra identidad.
- Herramientas no disponibles, respuestas lentas y operaciones que pueden repetirse.
- Contenido externo con instrucciones que el agente debe tratar como datos, no como autorización.
Ejemplo didáctico: un agente que prepara citas
Supón que el agente puede consultar huecos y proponer una cita, pero necesita confirmación antes de crearla. La prueba debe comprobar fecha, zona horaria, disponibilidad y destinatario, además de que no ejecuta la reserva sin esa confirmación. Este escenario es didáctico; no atribuye una integración o una validación real a PotenzIA.
Añade una solicitud repetida y un calendario que deja de responder después de recibir la operación. El comportamiento esperado debe contemplar cómo averiguar si la cita llegó a crearse antes de repetirla. Evalúa la salida al usuario y el estado del calendario por separado.
Mide calidad, acciones y esfuerzo de revisión
Registra si se completó la tarea, si se respetaron permisos y si hubo que corregir el resultado. Anota también duración, uso de herramientas, consumo y tiempo humano de revisión. Ninguna métrica aislada explica si el agente es adecuado para el proceso que lo utilizará.
Clasifica los errores por su efecto. Una frase mejorable y una acción no autorizada requieren respuestas diferentes. Define qué fallos impiden avanzar aunque otros casos funcionen, y quién puede valorar los resultados dudosos. Si utilizas otro modelo para puntuar respuestas, contrasta sus decisiones con una revisión humana.
Repite cuando cambie lo que condiciona el resultado
Conserva la versión del modelo, las instrucciones, las herramientas y los datos utilizados. Ejecuta los casos afectados al modificar esas piezas. La observabilidad debe permitir reconstruir el recorrido necesario para investigar, evitando guardar por rutina secretos o información personal que no hace falta para ese propósito.
Una evaluación local satisfactoria sirve para decidir el siguiente paso, no para prometer ausencia de errores futuros. Define seguimiento, responsable de incidencias y forma de pausar acciones. Incorpora nuevos casos cuando aparezcan fallos o cambie el uso, y revisa si los límites iniciales siguen teniendo sentido.
Fuentes y documentación
Documentación del proveedor o del organismo citado. Los ejemplos de esta ficha son didácticos; no describen resultados de clientes.
