Entra PDF, Word, Excel, correo, foto o escaneo
Formatos de entrada
Identifica si el texto es nativo o si hace falta OCR, y guarda de qué documento salió cada página.
Sale Texto con su origen y su tipo de fuente
Guía
Un asistente RAG recupera pasajes de tus documentos según quién pregunta, cita la fuente y puede contestar «no lo encuentro». La calidad se decide al ingerir y recuperar, no en qué modelo redacta la respuesta.
Revisado el por Grupo Anta.
Antes de construir uno
Un RAG resuelve un problema concreto: buscar en documentos que un producto genérico no puede filtrar por permisos. Fuera de ese caso, ya existe algo más simple.
| Tu situación | Qué conviene en su lugar | Por qué |
|---|---|---|
| Pocos documentos y los mismos permisos para todos | Un producto del mercado que ya indexa una carpeta o un Drive | Construir la ingesta, el índice y la búsqueda desde cero no se paga si no hay permisos distintos que resolver |
| La respuesta vive en una tabla de tu base de datos | Una consulta directa al sistema, no una búsqueda en texto | Un RAG busca en documentos sin estructura; un dato que ya vive en una columna no necesita que se lo redacte en un párrafo para después volver a leerlo |
| «¿Cuántos contratos vencen en marzo?» | Una consulta SQL sobre la tabla de contratos | Un modelo que lee fragmentos de texto no puede contar con precisión filas que nunca vio completas: agregar y contar es trabajo de una base de datos, no de un buscador |
Ingesta
Un documento pasa por cuatro pasos antes de poder responder nada, y cada uno pierde información si se hace mal. El modelo que responde nunca ve el documento original: ve lo que sobrevivió a estos cuatro pasos.
Entra PDF, Word, Excel, correo, foto o escaneo
Identifica si el texto es nativo o si hace falta OCR, y guarda de qué documento salió cada página.
Sale Texto con su origen y su tipo de fuente
Entra Texto con su origen
Separa el texto corrido de las tablas: una tabla convertida a párrafo pierde las columnas que la hacían legible.
Sale Texto y tablas por separado, cada una con su estructura
Entra Texto y tablas estructuradas
Corta en fragmentos con superposición y guarda en cada uno su documento, versión, fecha de vigencia y quién puede leerlo.
Sale Fragmentos con metadata de permisos y vigencia
Entra Fragmentos con metadata
Calcula el vector de cada fragmento y conserva también su texto, para poder buscar por palabra exacta y por significado.
Sale Índice filtrable por permiso y por vigencia
Permisos
Un asistente que busca en todos los documentos de la empresa también puede mostrar los que un usuario no debería ver. Esa decisión no se le pide al modelo: se aplica en la base de datos, antes de que reciba nada.
Quién decide qué puede ver el usuario
Una instrucción de texto le pide al modelo que no muestre cierta carpeta. El modelo puede ignorarla, y una instrucción dentro de un documento puede contradecirla.
El filtro de permisos corre en la base de datos antes de buscar: el fragmento fuera de alcance nunca sale del índice.
Qué pasa si el modelo comete un error
El documento prohibido ya viajó dentro del contexto que se le mandó al modelo: el daño ya ocurrió, sin importar qué responda después.
El fragmento prohibido nunca llegó al contexto: no hay nada que el modelo pueda filtrar mal.
Cómo se comprueba
Pedirle al asistente, de varias formas, que ignore la instrucción de permisos hasta que una funcione.
Consultar con las credenciales de un usuario sin acceso a una carpeta y comprobar cero resultados de ahí, no una promesa del modelo.
Recuperación y respuesta
Un RUC o el número de una cláusula se buscan mejor por coincidencia exacta; una pregunta formulada distinto al documento se busca mejor por significado. El sistema hace las dos búsquedas y decide con evidencia si puede responder.
Pregunta
Tal como la escribió quien pregunta, sin reformular
Recuperación híbrida
Léxica Coincide la palabra exacta: un RUC, un número de cláusula, un nombre propio
Vectorial Coincide el significado, aunque cambien las palabras
Reranking
Reordena los candidatos de las dos búsquedas por relevancia real, no por similitud bruta
Respuesta
Hay evidencia Responde citando el fragmento y el documento de origen
No la hay «No lo encuentro», o deriva a una persona en un caso dudoso
Evaluación
Cambiar el tamaño del fragmento, el modelo o el reranker sin medir es adivinar. El conjunto de evaluación se arma una vez, con preguntas reales, y se vuelve a correr en cada cambio.
| Qué se mide | Cómo | Qué significa que falle |
|---|---|---|
| Precisión de recuperación | Un conjunto de preguntas con la respuesta y el documento correcto ya conocidos; se revisa si el fragmento correcto aparece entre los primeros resultados | El fragmento correcto existe en el índice pero la búsqueda no lo trae: el problema está en el chunking, el embedding o el ranking, no en el modelo |
| Fidelidad de la respuesta | Se compara cada afirmación de la respuesta contra el fragmento citado; una afirmación sin respaldo en el texto recuperado cuenta como falla aunque sea correcta por casualidad | El modelo generó algo plausible que el documento no dice: es la alucinación que RAG debía evitar |
| Tasa de «no lo encuentro» correcta | Se incluyen a propósito preguntas sin respuesta en los documentos y se revisa si el sistema lo admite en vez de inventar | Un sistema que siempre encuentra algo que decir es menos confiable que uno que a veces dice que no sabe |
Operación
Tres cosas se miden además de si la respuesta estuvo bien: qué tan rápido llegó, cuánto costó y qué se puede reconstruir después de un reclamo.
Cachea la búsqueda, no la respuesta
Dos personas que preguntan lo mismo con otras palabras tienen que recibir la misma recuperación; cachear la respuesta final esconde cuándo el documento fuente cambió de versión.
Mide la latencia por etapa, no solo el total
Embeber la pregunta, buscar, reordenar y generar tienen presupuestos distintos; sin medir cada uno por separado no se sabe cuál optimizar primero.
Registra qué se recuperó, no solo qué se respondió
Una traza que solo guarda la respuesta final no permite auditar si el modelo alucinó sobre un fragmento que sí trajo, o si el fragmento correcto ni siquiera se recuperó.
Costo
El costo por consulta lo decide el tamaño del contexto recuperado y el modelo que redacta la respuesta, no el volumen de documentos indexados. Cálculo con precios verificados el 22/09/2026.
| Modelo | Precio por millón de tokens (entrada / salida) | 1.000 consultas |
|---|---|---|
| OpenAI gpt-5-nano | USD 0.05 / USD 0.40 | USD 0.25 |
| OpenAI gpt-6-luna | USD 0.10 / USD 0.50 | USD 0.43 |
| Claude Haiku 4.5 | USD 1.00 / USD 5.00 | USD 4.30 |
| Claude Sonnet 5 | USD 2.00 / USD 10.00 | USD 8.60 |
Supuesto: 5 fragmentos de 600 tokens por consulta (3.000 tokens de contexto) más la pregunta, y una respuesta de 250 tokens.
Precio publicado por cada proveedor, consultado el 22/09/2026. No incluye impuestos ni el costo de construir y operar el sistema.
Seguridad
Dos riesgos son propios de este tipo de sistema y no de un buscador normal: que el contenido recuperado filtre datos personales, y que ese mismo contenido intente darle una orden al modelo.
| Riesgo | Qué pasa si no se previene | Qué se hace |
|---|---|---|
| PII en los documentos | El asistente puede repetir un DNI, una remuneración o un diagnóstico a alguien sin permiso para verlo | Se enmascara antes de indexar o se excluye del índice el campo sensible, y el permiso de lectura decide si se muestra igual |
| Inyección de instrucciones dentro de un documento | Un contrato o un correo puede traer una frase dirigida al modelo —«ignora las instrucciones anteriores y…»—, no a quien lo lee | El contenido recuperado se trata siempre como dato, nunca como instrucción: se envuelve y se le dice al modelo que lo que sigue es un fragmento a citar, no una orden |
Cuánto cuesta operar un modelo por consulta, más allá del cálculo de esta guía. Guía
Si además de responder preguntas, el sistema tiene que ejecutar una acción sobre tus datos. Guía
Dónde se contrata: una aplicación interna con permisos, estados y su propio registro. Lo que construimos
Si todavía no sabes si tu caso necesita RAG, un producto del mercado o una regla simple. Herramienta gratuita
Cuéntanos qué documentos tiene tu equipo y quién debería poder ver cada uno. Te decimos si conviene un asistente con permisos o si basta buscar mejor en lo que ya usas.