América
Latina
09
Nivel avanzadoProducciónEvaluación y observabilidad

Evaluación y operación
de sistemas de IA.

Convierte un prototipo de IA generativa en un servicio que puede medirse, compararse, observarse y recuperarse cuando algo falla.

Sistema · producción
Calidad92%↑ dentro del umbral
Latencia p952.4sobjetivo < 3s
Fallos073 requieren revisión
Costo / tarea0.08controlado
Recorrido5 lecciones + proyecto
ResultadoPuerta de lanzamiento documentada
RequisitoPrototipo técnico funcional
La propuesta

Una buena demostración todavía no es un servicio confiable

Los sistemas generativos cambian cuando cambia un modelo, una instrucción, una fuente de datos o la distribución de preguntas reales. Las pruebas tradicionales siguen siendo necesarias, pero no alcanzan para medir respuestas abiertas y recorridos variables.

Este curso organiza el ciclo completo: contrato de calidad, conjunto de evaluación, experimentos reproducibles, trazas, métricas operativas, despliegue gradual y respuesta a incidentes. La meta es poder explicar si una nueva versión realmente es mejor y qué hacer cuando deja de serlo.

Al terminar

Podrás tomar decisiones de producción con evidencia

01

Traducir requisitos de producto y riesgo en casos, métricas y umbrales de aceptación.

02

Comparar modelos, instrucciones y arquitecturas mediante experimentos reproducibles.

03

Observar trazas, calidad, seguridad, latencia, costo y comportamiento de herramientas.

04

Diseñar despliegues graduales, alertas, respuesta a incidentes y ciclos de mejora.

Programa

Del contrato de calidad a la respuesta operativa

01

Contrato del sistema y taxonomía de fallos

Define usuarios, tareas, límites, riesgos y criterios de éxito. Clasifica errores de datos, recuperación, razonamiento, herramientas, formato y seguridad.

02

Conjuntos de evaluación y métricas

Construye casos representativos y extremos, combina verificaciones deterministas, revisión humana y evaluadores automáticos calibrados.

03

Experimentos, versiones y lanzamientos

Versiona instrucciones, modelos, datos y configuración; compara candidatos; registra decisiones y prepara despliegues graduales con reversión.

04

Trazas, observabilidad y economía

Instrumenta cada paso, conecta respuesta con insumos y herramientas, mide latencia y costo, y crea alertas sobre señales que requieren acción.

05

Incidentes, retroalimentación y mejora continua

Diseña rutas de escalamiento, preserva evidencia, limita impacto, incorpora señales de usuarios y actualiza evaluaciones después de cada fallo relevante.

Revisión final

Presenta la preparación de producción de tu sistema

Aplicarás el método a un prototipo propio o de práctica y entregarás su contrato, evaluación automatizada, comparación de versiones, esquema de observabilidad y ejercicio de incidente.

Calidad

Casos, métricas, umbrales y resultados.

Operación

Trazas, alertas, latencia y costos.

Resiliencia

Despliegue, reversión e incidente simulado.

Perfil

Para equipos responsables de que la IA siga funcionando

Ideal para

Ingeniería de IA y software, producto técnico, datos, calidad, plataforma, seguridad y operación de servicios generativos.

Base requerida

Programación, APIs, pruebas, control de versiones y acceso a un prototipo de IA con el que puedas ejecutar experimentos y recopilar trazas.

Curso abierto · Acceso inmediato

Aprende, practica y termina a tu ritmo.

Todo el material está disponible en esta página. No necesitas registrarte. Lee cada lección, realiza la práctica y reúne los entregables para completar el proyecto final.

Tiempo estimado
6–8 horas
Resultado
Una puerta de lanzamiento con conjunto de evaluación, métricas, trazas y respuesta a incidentes.
01

Contrato del sistema y fallos

Describe usuarios, tareas, entradas, salidas, dependencias y consecuencias. Define éxito por tarea, no con una impresión general. Construye una taxonomía de fallos de datos, recuperación, razonamiento, herramientas, formato, seguridad y experiencia.

Prioriza errores por severidad y detectabilidad. Un promedio alto puede ocultar un fallo raro pero catastrófico; las puertas críticas se evalúan por separado.

Práctica guiada

Clasifica treinta fallos históricos o hipotéticos y asigna severidad, frecuencia y propietario.

Entregable
  • Contrato, taxonomía y lista de fallos críticos.
02

Conjuntos representativos y extremos

Muestrea casos reales respetando privacidad y añade situaciones límites diseñadas. Conserva distribución, idioma, longitud, perfiles de usuario y dificultad. Separa un conjunto de desarrollo de otro que solo se use para decisiones de lanzamiento.

Versiona casos y respuestas esperadas. Revisa que el conjunto no premie una forma superficial y que incluya abstenciones cuando no existe respuesta segura.

Práctica guiada

Construye veinte casos normales, diez extremos y cinco sin respuesta válida.

Entregable
  • Conjunto versionado con procedencia y criterios.
03

Métricas y evaluadores calibrados

Usa verificaciones deterministas para formato, citas y cálculos cuando sea posible. Define rúbricas humanas para utilidad, exactitud y daño. Los evaluadores basados en modelos se comparan contra juicios humanos y no se tratan como verdad.

Mide desacuerdo entre revisores y analiza errores por categoría, no solo un puntaje global. Cada métrica debe conectar con una decisión operativa.

Práctica guiada

Evalúa diez casos con dos personas y un evaluador automático; compara desacuerdos.

Entregable
  • Rúbrica, calibración y límites declarados de cada métrica.
04

Versiones, trazas, costo y latencia

Registra instrucciones, modelo, parámetros, herramientas, datos recuperados y configuración. Una traza debe permitir reconstruir por qué ocurrió una salida sin guardar información innecesaria.

Compara candidatos en calidad, errores críticos, latencia y costo. Establece presupuestos y alertas; optimizar precio sin observar calidad traslada el costo a usuarios y soporte.

Práctica guiada

Ejecuta dos configuraciones sobre el mismo conjunto y prepara un informe de diferencias.

Entregable
  • Tabla comparativa, trazas de fallos y recomendación justificada.
05

Lanzamiento gradual e incidentes

Despliega primero a una fracción controlada, con supervisión y reversión. Define indicadores de salud y límites que detienen el lanzamiento. Preserva evidencia cuando aparece un incidente y comunica a responsables y personas afectadas.

Después del incidente, corrige la causa, añade casos de regresión y revisa si los controles organizativos fallaron. La operación convierte cada fallo relevante en aprendizaje verificable.

Práctica guiada

Simula un lanzamiento y un incidente desde alerta hasta cierre.

Entregable
  • Plan de despliegue, runbook, cronología y prueba de regresión.
Proyecto final

Demuestra lo aprendido con un resultado verificable

Construir el paquete operativo que permite comparar, lanzar y vigilar una versión de un sistema de IA.

Pasos

  1. 01

    Escribe el contrato y la taxonomía de fallos.

  2. 02

    Construye un conjunto representativo y extremo.

  3. 03

    Define métricas y calibra evaluadores.

  4. 04

    Compara dos versiones con trazas, costo y latencia.

  5. 05

    Diseña lanzamiento gradual, reversión e incidentes.

Criterios de finalización

Finalización honesta: este curso es autoguiado y no emite un certificado. Considéralo terminado cuando puedas mostrar los entregables, explicar tus decisiones y cumplir los cuatro criterios sin depender de una respuesta no verificada.

Construye antes de operar

Trae un sistema que tenga decisiones reales que medir

Diseño de agentes de IA ofrece la base para construir herramientas, estado y trayectorias que luego pueden evaluarse en producción.

Ver diseño de agentes ↗
Preguntas frecuentes

Antes de empezar

¿Este curso depende de un proveedor de nube?

No. Los patrones de evaluación, versionado, trazas, despliegue y respuesta a incidentes son transferibles y puedes aplicarlos en el entorno que ya utilizas.

¿Necesito tener un sistema en producción?

No necesariamente, pero sí necesitas un prototipo funcional o reproducible que permita ejecutar casos, cambiar versiones y recopilar resultados.

¿La evaluación automática reemplaza la revisión humana?

No. El curso combina verificaciones deterministas, evaluadores automáticos calibrados y revisión humana para los criterios que necesitan juicio contextual.