Contexto largo frente a RAG para soporte en 2026: cuándo incluir todo supera a la recuperación
Los modelos ya aceptan bases de conocimiento enteras en el prompt. Esta es la comparación real de coste, latencia, precisión y mantenimiento frente a RAG.
TL;DR:
- Las ventanas de contexto de 2026 pueden contener muchas bases de soporte completas: Claude llega a cientos de miles de tokens y Gemini a millones.
- Incluir una base completa es más sencillo que RAG, pero 200,000 tokens pueden costar alrededor de $0.60 por consulta. Con 10,000 consultas serían $6,000.
- RAG continúa siendo más barato, rápido y fácil de actualizar por partes.
- La respuesta habitual es híbrida: contexto largo para la conversación y el ticket activo; RAG para la base de conocimiento.
- El contexto largo gana cuando hay menos de 100 documentos, pocas consultas o un prototipo.
En 2024 nadie defendía seriamente omitir RAG. Las ventanas tenían 8K o 32K tokens. En 2026 la pregunta es real: puedes meter cientos de páginas en un prompt y hacer la consulta directamente.
Algunos equipos han eliminado su base vectorial y les ha funcionado. Otros se han quemado. Este es el intercambio real en soporte.
Definiciones rápidas
RAG: indexa la base en Pinecone, pgvector, Weaviate u otro almacén. En cada pregunta recupera entre 5 y 20 fragmentos relevantes, los añade al prompt y genera. El modelo ve unos miles de tokens.
Contexto largo: omite la recuperación e incluye toda la base en cada prompt. El modelo decide qué partes importan dentro de 100K a millones de tokens.
Ambos buscan una respuesta fundamentada. Coste, latencia y precisión son muy distintos.
En RAG, el trabajo difícil está antes de la generación: dividir bien los documentos, crear embeddings, recuperar con filtros y ordenar los resultados. En contexto largo, ese pipeline desaparece, pero cada consulta obliga al modelo a volver a recorrer una biblioteca completa. La simplicidad arquitectónica no significa que el trabajo computacional haya desaparecido.
Ventanas de contexto en 2026
| Modelo | Contexto de entrada aproximado | Salida | Precio de entrada por 1 M de tokens |
|---|---|---|---|
| Claude Opus | 200K | 32K | $15 |
| Claude Sonnet | 200K | 32K | $3 |
| GPT-5 | 128K o más según variante | 16K | $5 de referencia |
| GPT-5 Mini | 128K o más | 16K | $0.50 de referencia |
| Gemini 2.5 Pro | Hasta 2 M | 8K | $1.25 debajo de 200K; $2.50 encima |
| Gemini 2.5 Flash | Hasta 1 M | 8K | $0.30 |
Son cifras de referencia de mayo de 2026 y cambian. Verifica siempre las páginas oficiales.
Como escala, 200K tokens son unas 150,000 palabras o una novela de 400 páginas. Un centro de ayuda con 500 artículos de 600 palabras ronda 400K tokens: demasiado para algunas ventanas, pero cómodo para otras.
Que un documento quepa no garantiza que el modelo lo use con igual precisión. La ventana publicada es un límite técnico, no una promesa de que cada dato dentro de ella reciba la misma atención. También debes reservar espacio para el prompt de sistema, el historial de conversación, resultados de herramientas y la respuesta.
Las cuentas de coste que casi nadie hace
Supón una base de 100,000 tokens, unas 75,000 palabras o 125 artículos.
Contexto largo con Claude Sonnet:
- 100,000 tokens de base + 500 de sistema + 200 de pregunta.
- 300 tokens de salida.
- A $3 por millón de entrada y $15 de salida: unos $0.31 por consulta.
- 10,000 consultas: $3,100 al mes.
- 50,000 consultas: $15,500 al mes.
RAG con el mismo modelo:
- Ocho fragmentos de 500 tokens: 4,000 tokens.
- 4,700 tokens totales de entrada y 300 de salida.
- Aproximadamente $0.019 por consulta.
- 10,000 consultas: $190 al mes, más entre $20 y $200 de almacenamiento.
- 50,000 consultas: $950 al mes.
RAG cuesta unas 16 veces menos en este ejemplo. A escala, decide la economía del producto.
El caché reduce la diferencia. Si el prefijo de 100K se cobra al 10% tras el primer uso, la consulta cae aproximadamente a $0.034. Sigue por encima de RAG, pero puede compensar por simplicidad. Solo ayuda mientras el contenido cacheado siga idéntico y no expire.
La primera escritura del caché también puede costar más que una entrada normal. Un centro de ayuda que cambia cada pocos minutos o un prompt personalizado por cliente obtiene menos aciertos. Calcula por separado escrituras, lecturas, expiraciones e invalidaciones; no presupongas que todas las consultas recibirán el descuento máximo.
La matemática de latencia
El tiempo hasta el primer token es lo que ve el usuario.
RAG: 50-200 ms de búsqueda más 200-400 ms del modelo con un prompt pequeño. Total aproximado: 300-600 ms.
Contexto largo: en pruebas de referencia, 100K tokens pueden tardar 1.2-2.1 segundos; 200K, 2-4 segundos; un millón, 4-8 segundos. Cambia por región, carga y plan.
En un widget, 400 ms parecen instantáneos y dos segundos parecen una avería. En una herramienta interna donde el agente espera, importa menos.
También importa la variabilidad, no solo la media. Una respuesta que normalmente tarda dos segundos pero a veces tarda ocho se siente menos fiable que una recuperación estable. Mide percentiles p50 y p95 desde la región y el plan que usarás en producción.
La cuestión de precisión
La intuición dice que más contexto es mejor. Los estudios muestran matices. El trabajo RAG or Long-Context LLMs? A Comprehensive Study and Hybrid Approach comparó nueve benchmarks:
- El contexto largo ganó ligeramente cuando recibió la misma información.
- La diferencia habitual fue de 1 a 5 puntos.
- El coste fue entre 10 y 50 veces mayor.
- Un routing híbrido logró aproximadamente 95% de la precisión con 30% del coste.
El problema de "perdido en el medio" persiste: la información en el centro de un prompt enorme puede recuperarse entre 10% y 20% peor que al principio o final. En una base de 500 artículos es una penalización real.
La lectura honesta: el contexto largo compite en precisión si cabe la base y puedes pagar; RAG es más barato, rápido y suficientemente preciso para la mayoría.
RAG tampoco gana automáticamente. Una mala segmentación puede separar una excepción de la regla que modifica; embeddings débiles pueden recuperar un artículo con las mismas palabras pero otro producto; y un top_k demasiado pequeño puede omitir la respuesta. Evalúa ambos sistemas con las mismas preguntas, incluidas políticas contradictorias y respuestas que no existen.
Comparativa directa
| Dimensión | RAG | Contexto largo |
|---|---|---|
| Coste con base de 100K | $0.019 | $0.31, o $0.034 con caché |
| Primer token | 300-600 ms | 1.2-8 s según tamaño |
| Límite de base | Prácticamente ilimitado | Ventana del modelo |
| Actualización | Reindexar un fragmento | Reemplazar e invalidar el prompt |
| Complejidad | Base vectorial, chunking y ranking | Incluir la base |
| Multi-tenant | Filtro por cliente | Un contexto por cliente |
| Mejor para | Volumen y bases grandes | Bases pequeñas y prototipos |
| Fallo típico | Recupera el fragmento equivocado | No encuentra el dato dentro del prompt |
Cuándo gana el contexto largo
Bases pequeñas de menos de 100 documentos. Ochenta artículos de 500 palabras caben fácilmente. Con caché, el coste puede quedar en $0.02-$0.04 y no se justifica operar una base vectorial.
En ese caso, incluir todo elimina una clase completa de errores de recuperación. El equipo puede centrarse en el contenido y en el prompt, y migrar a RAG solo cuando el volumen o el tamaño lo exijan.
Memoria de conversación. Conservar 50 turnos entre sesiones encaja naturalmente en contexto. Indexar y recuperar mensajes del propio usuario añade complejidad poco útil.
No hace falta conservar cada token para siempre. Resume los turnos antiguos y mantiene sin comprimir los recientes, el ticket activo y cualquier dato que el usuario haya corregido.
Prototipos. Antes de invertir en RAG, pega la base en un prompt y valida si el agente aporta valor.
Documentos estructurados largos. Una política de 50 páginas, especificación de API o contrato necesita referencias cruzadas que el chunking puede separar.
Este patrón es especialmente útil cuando las definiciones del principio modifican tablas o anexos posteriores. Puedes recuperar el documento completo solo para esas preguntas, en vez de incluirlo en todas.
Copilotos internos con poco volumen. Cien consultas diarias a $0.30 son $900 mensuales; puede ser aceptable frente a una semana de ingeniería.
Cuándo gana RAG
Bases de más de 200 documentos. Cuando se supera la ventana, deja de ser opcional. Usar una ventana de millones añade mucha latencia y empeora la recuperación central.
Además, una base grande suele contener versiones, productos e idiomas distintos. Los metadatos de RAG permiten descartar material incorrecto antes de que el modelo lo vea.
Gran volumen. Por encima de 10,000 consultas, la diferencia de coste domina.
Actualizaciones frecuentes. RAG reindexa solo lo cambiado. En contexto largo, cada cambio invalida caché.
SaaS multi-tenant. Quinientos clientes significan quinientos prompts; RAG filtra con customer_id.
Ese filtro también es un límite de seguridad. No basta con pedir al modelo que ignore documentos de otros clientes; el contenido no autorizado nunca debe entrar en el prompt.
Economía sensible. Si cobras por resolución, pasar de dos a treinta centavos destruye el margen.
El patrón híbrido de producción
La respuesta real no es pura:
Memoria de conversación: contexto largo. Los últimos 20-50 turnos viven en el prompt para dar continuidad.
Base de conocimiento: RAG. Artículos, documentación y políticas se indexan; se recuperan entre 5 y 10 fragmentos por pregunta.
Estado de cuenta: llamada a herramienta. Plan, pedidos y tickets se consultan cuando hacen falta; no se incluyen siempre ni se indexan como documentación.
Esta separación mantiene cada fuente en su lugar: conocimiento relativamente estable en el índice, estado transaccional en sistemas autorizados y conversación en el contexto. También simplifica borrar o actualizar datos.
Documentos largos: fallback de contexto. Si hay que razonar sobre una política o contrato completo, la herramienta puede devolverlo entero.
Chatsy usa conversación reciente en el prompt y recuperación sobre la base de conocimiento. No envía toda la base en cada pregunta porque el coste y la latencia no compensan.
Cuándo este análisis se equivoca
Los precios bajan. Un modelo pequeño y barato cambia la cuenta. RAG puede seguir ganando, pero por menos.
El caché mejora. TTL más largos y mayores descuentos volverían viable más contexto.
Tu base es diminuta. Con 30 artículos, pega el contenido en un prompt y publica. RAG puede ser excesivo.
Hay otra excepción: si las preguntas son pocas y predecibles, una búsqueda tradicional o incluso respuestas escritas puede superar a ambos enfoques en coste y control. No introduzcas un pipeline generativo donde no aporta nada.
Cuándo no elegir contexto largo
Quédate con RAG si:
- La base supera 500 documentos.
- Gestionas más de 10,000 consultas al mes.
- Tu equipo puede operar una base vectorial.
- El contenido cambia a diario.
- Sirves a múltiples clientes con bases aisladas.
- Necesitas menos de cinco centavos por consulta.
Si se cumplen tres o más, no adoptes contexto largo solo por una diapositiva de un proveedor.
Preguntas frecuentes
¿Murió RAG en 2026?
No. Sigue siendo más barato, rápido y escalable. El caché, los enfoques híbridos y mejores embeddings cambian su configuración, no la idea de recuperar y generar.
¿Puedo usar Gemini con dos millones de tokens y omitir RAG?
Sí técnicamente. Una base de un millón puede costar unos $2.50 por consulta: $25,000 para 10,000. Además persiste el problema de información perdida en el medio. Muchos equipos terminan añadiendo RAG por coste o latencia.
¿El caché abarata suficiente el contexto largo?
Lo acerca. Una base de 100K puede bajar de $0.30 a $0.03, frente a unos $0.02 con RAG. Esa diferencia puede justificar simplicidad si falta capacidad de ingeniería.
¿Y contexto para conversación y RAG para la base?
Es el patrón recomendado: los turnos recientes viven en el prompt; la base grande y multi-tenant se recupera bajo demanda.
Qué significa al elegir un chatbot
Si construyes desde cero, no sobreingenierices. Empieza con contexto largo si la base es pequeña; añade RAG al crecer por coste, latencia o tamaño.
Si compras, pregunta qué hace el proveedor. Afirmar que envía dos millones de tokens en cada consulta es una señal de coste descontrolado. Explicar que usa recuperación y contexto para memoria indica una arquitectura sensata.
Chatsy recupera contenido relevante de tu base y conserva el contexto reciente de conversación. El plan gratuito incluye 40 créditos al mes y los planes de pago cuestan entre $40 y $500 mensuales. Consulta precios.