De 0 a Langfuse
Deja de opinar sobre si tu IA funciona y empieza a medirlo. Langfuse es la plataforma open source (núcleo MIT) para ver qué hace tu aplicación por dentro, ponerle nota y comprobar si tu último cambio la mejoró o la empeoró. Trazas, scores, el modelo como juez, datasets y experimentos, gestión de prompts, y la verdad sobre lo que cuesta autoalojarlo.
Qué vas a aprender
- Entender por qué una aplicación con IA no se puede depurar ni dar por buena como el software de siempre.
- Instrumentar tu aplicación y leer una traza: qué pasó, cuánto tardó y cuánto costó.
- Escribir trazas que sirvan para algo, con nombres, metadatos, usuarios y sesiones, y sin filtrar datos sensibles.
- Usar los scores como unidad de medida y elegir el método de evaluación adecuado a cada caso.
- Montar un juez automático sabiendo dónde se equivoca y por qué hay que evaluar al evaluador.
- Cerrar el ciclo con datasets y experimentos: comparar versiones y bloquear un despliegue que empeora.
- Decidir entre el servicio gestionado y autoalojarlo, con las cuatro piezas de infraestructura que eso implica.
Requisitos
- Eres desarrollador y ya tienes (o estás construyendo) algo que llama a un modelo de lenguaje: un chat, un agente, una función que resume. Python básico para los ejemplos. No hace falta saber nada de observabilidad ni de evaluación: eso es el curso.
Currículum del curso
7 módulo. Inscríbete para acceder al contenido completo.
-
00
No sabes si funciona
—Entender por qué una aplicación con IA se te escapa de las manos sin instrumentación, y qué es exactamente Langfuse.
12 min -
01
Tu primera traza
—Instrumentar tu aplicación, ver la primera traza y entender la jerarquía de tres niveles con la que Langfuse organiza todo lo demás.
14 min -
02
Trazas que sirven de algo
—Escribir trazas que sigan sirviendo dentro de seis meses y con volumen, y no mandar a un tercero datos que no debías.
15 min -
03
La nota que lo mide todo
—Entender los scores como la unidad de medida de todo el curso, y saber qué método de evaluación usar en cada caso.
14 min -
04
El modelo como juez
—Montar evaluación automática y saber exactamente dónde falla, cuánto cuesta y cómo comprobar que mide lo que crees.
15 min -
05
Datasets y experimentos
—Cerrar el ciclo: montar un conjunto de casos, ejecutar tu aplicación contra él, comparar versiones y bloquear un despliegue que empeora.
16 min -
06
Prompts, paneles y la decisión
—Cerrar el círculo con la gestión de prompts y los paneles, y decidir con datos si autoalojas o pagas.
16 min
¿Te interesa?
Inscríbete para empezar
Al inscribirte podrás abrir los módulos, hacer los quizzes y guardar tu progreso.