Evaluación y operación
de sistemas de IA.
Convierte un prototipo de IA generativa en un servicio que puede medirse, compararse, observarse y recuperarse cuando algo falla.
Una buena demostración todavía no es un servicio confiable
Los sistemas generativos cambian cuando cambia un modelo, una instrucción, una fuente de datos o la distribución de preguntas reales. Las pruebas tradicionales siguen siendo necesarias, pero no alcanzan para medir respuestas abiertas y recorridos variables.
Este curso organiza el ciclo completo: contrato de calidad, conjunto de evaluación, experimentos reproducibles, trazas, métricas operativas, despliegue gradual y respuesta a incidentes. La meta es poder explicar si una nueva versión realmente es mejor y qué hacer cuando deja de serlo.
Podrás tomar decisiones de producción con evidencia
Traducir requisitos de producto y riesgo en casos, métricas y umbrales de aceptación.
Comparar modelos, instrucciones y arquitecturas mediante experimentos reproducibles.
Observar trazas, calidad, seguridad, latencia, costo y comportamiento de herramientas.
Diseñar despliegues graduales, alertas, respuesta a incidentes y ciclos de mejora.
Del contrato de calidad a la respuesta operativa
Contrato del sistema y taxonomía de fallos
Define usuarios, tareas, límites, riesgos y criterios de éxito. Clasifica errores de datos, recuperación, razonamiento, herramientas, formato y seguridad.
Conjuntos de evaluación y métricas
Construye casos representativos y extremos, combina verificaciones deterministas, revisión humana y evaluadores automáticos calibrados.
Experimentos, versiones y lanzamientos
Versiona instrucciones, modelos, datos y configuración; compara candidatos; registra decisiones y prepara despliegues graduales con reversión.
Trazas, observabilidad y economía
Instrumenta cada paso, conecta respuesta con insumos y herramientas, mide latencia y costo, y crea alertas sobre señales que requieren acción.
Incidentes, retroalimentación y mejora continua
Diseña rutas de escalamiento, preserva evidencia, limita impacto, incorpora señales de usuarios y actualiza evaluaciones después de cada fallo relevante.
Presenta la preparación de producción de tu sistema
Aplicarás el método a un prototipo propio o de práctica y entregarás su contrato, evaluación automatizada, comparación de versiones, esquema de observabilidad y ejercicio de incidente.
Calidad
Casos, métricas, umbrales y resultados.
Operación
Trazas, alertas, latencia y costos.
Resiliencia
Despliegue, reversión e incidente simulado.
Para equipos responsables de que la IA siga funcionando
Ideal para
Ingeniería de IA y software, producto técnico, datos, calidad, plataforma, seguridad y operación de servicios generativos.
Base requerida
Programación, APIs, pruebas, control de versiones y acceso a un prototipo de IA con el que puedas ejecutar experimentos y recopilar trazas.