Lesson 03 — Costos, latencia y hallucinations en criollo
Poder estimar en 5 minutos cuánto te va a costar mensualmente un caso de uso, y explicarle al CFO por qué el número puede variar 3x según el modelo elegido.
Duración: 13 min · Prereq: Lesson 02
Objetivo
Poder estimar en 5 minutos cuánto te va a costar mensualmente un caso de uso, y explicarle al CFO por qué el número puede variar 3x según el modelo elegido.
Video
🎥 Video en producción — próximamente.
Cómo se cobra un LLM
Casi todos los modelos cobran por token, y separan input (lo que le mandás) de output (lo que responde). El output suele ser 3-5x más caro que el input.
Referencia rápida (rangos reales a mediados de 2026):
| Modelo | Input ($/1M tokens) | Output ($/1M tokens) |
|---|---|---|
| Modelo grande (Claude Opus / GPT-5) | $15–20 | $75–100 |
| Modelo medio (Claude Sonnet / GPT-4o) | $3–5 | $15–20 |
| Modelo chico (Haiku / GPT-4o mini) | $0.25–1 | $1–5 |
Regla de dedo: si tu caso hace 10.000 llamadas por mes con ~2000 tokens promedio, un modelo grande te cuesta ~$1.500-2.000/mes. Un modelo chico, ~$50-100/mes. Elegí bien.
Latencia
- Modelos grandes: 2-10 segundos por respuesta.
- Modelos chicos: 0.3-2 segundos.
- Streaming (empieza a responder mientras piensa) baja la percepción de latencia pero no el costo.
Regla: si tu usuario espera la respuesta viendo la pantalla, elegí modelo medio o chico. Si es batch (procesa en background y notifica), podés usar grande.
Hallucinations en criollo
El LLM "inventa" cuando:
- Le pedís algo que no sabe (info reciente, tu producto interno, un cliente específico).
- El prompt es ambiguo y "elige" una interpretación.
- La temperatura está alta.
Mitigaciones (sin código):
- Cita la fuente — pedile que diga "según [documento X]". Si no puede citar, no debería afirmar.
- Grounding — dale el documento en el contexto en vez de que "recuerde".
- Chequeo humano — para decisiones críticas, el LLM sugiere, humano aprueba.
Estimación práctica
Para tu caso de uso:
- ¿Cuántas llamadas por mes? (usuarios × frecuencia)
- ¿Cuántos tokens promedio por llamada? (input + output; asumí 2000-4000 para respuestas típicas)
- ¿Qué modelo necesitás? (grande si es análisis complejo, chico si es clasificación/extracción)
- Multiplicá.
Checkpoint
Marcá cada item cuando tengas evidencia. Se persiste en tu navegador (localStorage). No avanzás a la próxima lección hasta que estén todos verdes.