centinela Academy
Lecciones 01 ¿Qué es un LLM? Sin fórmulas 02 Prompt básico para negocio 03 Costos, latencia y hallucinations en criollo 04 Cuándo NO usar un LLM
Lección 03 · LLM Basics · Fundamentals · 1h

Lesson 03 — Costos, latencia y hallucinations en criollo

⏱ 13 min · prereq: Lesson 02

Poder estimar en 5 minutos cuánto te va a costar mensualmente un caso de uso, y explicarle al CFO por qué el número puede variar 3x según el modelo elegido.

Duración: 13 min · Prereq: Lesson 02

Objetivo

Poder estimar en 5 minutos cuánto te va a costar mensualmente un caso de uso, y explicarle al CFO por qué el número puede variar 3x según el modelo elegido.

Video

🎥 Video en producción — próximamente.

Cómo se cobra un LLM

Casi todos los modelos cobran por token, y separan input (lo que le mandás) de output (lo que responde). El output suele ser 3-5x más caro que el input.

Referencia rápida (rangos reales a mediados de 2026):

Modelo Input ($/1M tokens) Output ($/1M tokens)
Modelo grande (Claude Opus / GPT-5) $15–20 $75–100
Modelo medio (Claude Sonnet / GPT-4o) $3–5 $15–20
Modelo chico (Haiku / GPT-4o mini) $0.25–1 $1–5

Regla de dedo: si tu caso hace 10.000 llamadas por mes con ~2000 tokens promedio, un modelo grande te cuesta ~$1.500-2.000/mes. Un modelo chico, ~$50-100/mes. Elegí bien.

Latencia

  • Modelos grandes: 2-10 segundos por respuesta.
  • Modelos chicos: 0.3-2 segundos.
  • Streaming (empieza a responder mientras piensa) baja la percepción de latencia pero no el costo.

Regla: si tu usuario espera la respuesta viendo la pantalla, elegí modelo medio o chico. Si es batch (procesa en background y notifica), podés usar grande.

Hallucinations en criollo

El LLM "inventa" cuando:

  • Le pedís algo que no sabe (info reciente, tu producto interno, un cliente específico).
  • El prompt es ambiguo y "elige" una interpretación.
  • La temperatura está alta.

Mitigaciones (sin código):

  • Cita la fuente — pedile que diga "según [documento X]". Si no puede citar, no debería afirmar.
  • Grounding — dale el documento en el contexto en vez de que "recuerde".
  • Chequeo humano — para decisiones críticas, el LLM sugiere, humano aprueba.

Estimación práctica

Para tu caso de uso:

  1. ¿Cuántas llamadas por mes? (usuarios × frecuencia)
  2. ¿Cuántos tokens promedio por llamada? (input + output; asumí 2000-4000 para respuestas típicas)
  3. ¿Qué modelo necesitás? (grande si es análisis complejo, chico si es clasificación/extracción)
  4. Multiplicá.

Checkpoint

Marcá cada item cuando tengas evidencia. Se persiste en tu navegador (localStorage). No avanzás a la próxima lección hasta que estén todos verdes.

Evidence · Lesson 03 0 / 3 done