Agentes de IA
RAG: o que é a IA que responde com a fonte da sua empresa (e por que ela ainda erra)
RAG faz a IA consultar os documentos da empresa antes de responder. Reduz a resposta inventada, mas não zera: veja o que decide a qualidade.
Agendar diagnóstico gratuito de 30 minQuase todo diagnóstico que fazemos chega, em algum momento, à mesma pergunta: dá para ter uma IA que responda só com os documentos da empresa, e que diga de onde tirou a resposta? Dá. O nome técnico disso é RAG. O que pouca gente conta é a segunda metade da história: a fonte junto não transforma resposta errada em resposta certa. Ela transforma resposta errada em resposta errada com referência.
Este texto explica o que é RAG sem jargão, o que ele de fato melhora, por que ainda erra e o que separa um chatbot que lê PDF de um agente de conhecimento em que o time pode confiar.
O que é RAG, sem jargão
RAG é a sigla de retrieval-augmented generation, algo como geração aumentada por recuperação. O termo vem de um artigo de 2020 de Patrick Lewis e coautores, apresentado na conferência NeurIPS. A ideia é juntar duas memórias: a do próprio modelo, aprendida no treino, e uma memória externa, um índice de documentos consultado no momento da pergunta. No experimento original, essa memória externa era a Wikipédia.1
Na prática, dentro de uma empresa, o fluxo tem três passos:
- A pergunta chega: “qual o prazo de garantia do produto X para cliente de outro estado?”.
- O sistema busca na base da empresa — contratos, manuais, políticas, catálogo — os trechos mais relacionados à pergunta.
- O modelo recebe a pergunta junto com esses trechos e redige a resposta a partir deles, apontando de qual documento saiu cada afirmação.
A diferença é a de uma prova com consulta para uma prova de memória. Sem RAG, o modelo responde com o que lembra do treino, que não inclui o seu contrato de fornecedor nem a tabela de preço de março. Com RAG, ele responde com o que acabou de ler. Isso muda muito, mas não muda tudo.
O que muda quando a IA consulta antes de responder
O próprio artigo original lista o problema que o RAG ataca: modelos que só contam com a memória do treino não conseguem revisar ou ampliar essa memória com facilidade, não mostram de onde tiraram a resposta e podem produzir “alucinações”. Com uma memória externa, o conhecimento pode ser revisado diretamente e o que foi consultado pode ser inspecionado.1
O experimento mais útil para quem tem empresa está no meio do artigo. Os autores montaram uma lista de 82 líderes mundiais que mudaram entre 2016 e 2018 e perguntaram “quem é o presidente de tal país?” usando dois índices da Wikipédia. Com o índice da época certa, o sistema acertou 70% (2016) e 68% (2018). Com o índice trocado, acertou 12% e 4%. Ou seja: trocar o documento atualiza a resposta sem treinar modelo nenhum — e base desatualizada produz resposta desatualizada, com a mesma segurança na redação.1
Os grandes fornecedores descrevem a mesma coisa com nomes diferentes. O Google chama de grounding: a capacidade de conectar a saída do modelo a fontes verificáveis, o que, nas palavras da documentação, reduz as chances de inventar conteúdo. A OpenAI oferece o file search, que busca em arquivos enviados por busca semântica e por palavra-chave e devolve a resposta com citações dos arquivos. A Anthropic tem o recurso Citations, que devolve os trechos exatos dos documentos que sustentam cada afirmação.564
Por que RAG reduz, mas não zera, a resposta inventada
Um teste revelador vem do direito, área em que citação errada custa caro. Em 2024, Varun Magesh e coautores publicaram a primeira avaliação pré-registrada de ferramentas de pesquisa jurídica com IA baseadas em RAG. Fornecedores do setor anunciavam que o RAG acabava com as alucinações, ou que as citações eram livres delas. O resultado: as ferramentas da LexisNexis e da Thomson Reuters alucinaram entre 17% e 33% das vezes. Menos que um chatbot genérico (o estudo comparou com o GPT-4), mas muito longe do que o marketing dizia.2
O ponto mais importante do estudo é a definição. Os autores separam a resposta inventada da resposta “mal ancorada”: aquela que cita uma fonte real, mas que não sustenta a afirmação ou não se aplica ao caso. E escrevem que esse erro é potencialmente mais perigoso do que inventar uma fonte, porque é mais sutil e mais difícil de perceber. Conferir exige abrir a referência, ler e comparar com o que a IA afirmou.2
A documentação da Anthropic deixa essa fronteira clara sem querer. Ela afirma que as citações do recurso sempre apontam para trechos válidos dos documentos fornecidos. Isso garante que o trecho existe e está no documento — não que a conclusão tirada dele esteja certa. Fonte verificável é condição para conferir, não substituto da conferência.4
Onde o erro nasce
Scott Barnett e coautores relataram três projetos reais de RAG, em pesquisa, educação e área biomédica, e catalogaram sete pontos em que o sistema falha. Quase nenhum deles é culpa do modelo de linguagem:3
| Ponto de falha | O que acontece | O que isso pede da empresa |
|---|---|---|
| Conteúdo ausente | A resposta não está em documento nenhum, e o sistema responde mesmo assim | Regra explícita de recusa quando não há fonte |
| Documento certo fora do topo | A resposta existe, mas o trecho não ficou entre os primeiros resultados da busca | Documentos bem divididos, com título e metadado |
| Fora do contexto | O trecho foi encontrado, mas descartado antes de chegar ao modelo | Teste com perguntas reais antes de ir para produção |
| Não extraído | O trecho chegou ao modelo, mas havia ruído ou contradição demais | Uma versão vigente por assunto; documento velho fora da base |
| Formato errado | Pediu tabela ou lista e recebeu outra coisa | Instrução de formato testada |
| Especificidade errada | Resposta genérica demais ou detalhada demais para quem perguntou | Saber quem pergunta e para quê |
| Incompleta | Não está errada, mas deixa de fora informação que estava disponível | Perguntas compostas quebradas em partes |
As duas conclusões do trabalho valem para qualquer empresa: a validação de um sistema de RAG só é viável com ele em operação, e a robustez evolui com o uso em vez de nascer pronta no projeto.3
Se o erro nasce na base e na busca, é lá que a qualidade se decide. O modelo escolhido importa menos do que parece.
O que decide a qualidade: cinco coisas antes do modelo
1. Base documental organizada
Três versões do mesmo manual na mesma pasta viram três respostas possíveis. Antes de ligar a IA, alguém precisa dizer qual documento vale, apagar ou arquivar o resto e dar nome decente aos arquivos. É trabalho chato e é o que mais pesa no resultado.
2. Permissão de acesso
Se o estagiário não abre a pasta de salários, o agente que ele usa também não pode abrir. As ferramentas permitem isso: o file search da OpenAI, por exemplo, filtra os resultados pelos metadados dos arquivos. Mas a regra de quem vê o quê precisa existir antes, e ser aplicada na busca, não pedida ao modelo no texto do prompt.6
3. Atualização com dono
O experimento dos líderes mundiais mostra o tamanho do estrago de um índice velho: a precisão caiu de perto de 70% para 12% e 4% só por consultar a época errada. Toda base precisa de um responsável e de uma rotina de atualização — tabela de preço nova entra no mesmo dia, a antiga sai.1
4. Citação que dá para conferir
Citar “manual de vendas” não ajuda; citar o trecho e a página ajuda. Em PDF, por exemplo, a Anthropic devolve o intervalo de páginas citado. A mesma documentação avisa que PDF escaneado, sem texto extraível, não pode ser citado — um detalhe que derruba muito projeto feito em cima de pasta de contrato digitalizado.4
5. Recusar quando não há fonte
No caso feliz, dizem Barnett e coautores, o sistema responde algo como “desculpe, não sei” quando a resposta não está nos documentos. No caso real, perguntas parecidas com o conteúdo enganam o sistema e ele responde mesmo assim. “Não encontrei isso na base” é uma resposta boa, e precisa ser desenhada e testada de propósito.3
Chatbot com PDF ou agente de conhecimento: qual a diferença
Subir meia dúzia de PDFs numa ferramenta e começar a perguntar é RAG também. Serve para uso pessoal e para testar a ideia. A diferença para um agente de conhecimento que a empresa inteira usa está em tudo que fica em volta do modelo:
| Chatbot com PDF | Agente de conhecimento | |
|---|---|---|
| Base | Os arquivos que alguém subiu | Fontes definidas, com versão vigente |
| Atualização | Quando alguém lembra | Rotina com responsável |
| Permissão | Quem tem o link vê tudo | Cada pessoa vê o que já podia ver |
| Citação | Às vezes, nem sempre conferível | Trecho e documento em toda resposta |
| Sem fonte | Responde mesmo assim | Recusa e diz o que faltou |
| Qualidade | Impressão de quem usa | Perguntas de teste com resposta conhecida |
É a linha que seguimos nos nossos projetos de IA. No Safra AI, um assistente para agrônomos ancorado em bases oficiais (Agrofit/MAPA, ZARC) — sem internet aberta, resposta sempre com a fonte. O resultado que o projeto entrega é recomendação técnica sempre com a fonte oficial junto. No MedCode, um assistente clínico que responde por voz a partir de múltiplas bases médicas.
Por isso o nosso diagnóstico começa pela base e pelo tipo de pergunta, não pelo modelo. Às vezes a recomendação honesta é organizar a pasta antes de contratar qualquer IA.
Como começar sem gastar à toa
- Escolha um assunto pequeno e dolorido: as dúvidas de política comercial que chegam ao gerente, as perguntas técnicas que só uma pessoa sabe responder.
- Junte perguntas reais que o time já fez, com a resposta certa conhecida. Elas viram o teste do sistema antes e depois de ir ao ar.
- Defina o dono de cada fonte e a regra de quem pode ver o quê.
- Monte um protótipo e meça contra as perguntas de teste: quantas certas, quantas com fonte que sustenta, quantas recusas corretas.
- Só depois amplie para outros assuntos. A robustez cresce com o uso, como o relato de Barnett e coautores mostrou.
RAG é hoje a forma mais sensata de colocar IA para responder com o conhecimento da empresa. Mas ele desloca o trabalho, não o apaga: sai a tarefa de procurar a informação, entra a de cuidar da base e conferir o que importa. Quem entende isso desde o começo tem um agente útil. Quem compra a promessa de resposta sem erro descobre o problema na primeira citação que ninguém abriu.
Perguntas frequentes
RAG é a mesma coisa que treinar a IA com os dados da empresa?
Não. No treino, o conhecimento fica gravado no próprio modelo e mudar exige treinar de novo. No RAG, o modelo consulta os documentos no momento da pergunta; trocar ou atualizar um documento muda a resposta na hora, sem novo treino.
Com RAG a IA para de inventar respostas?
Inventa menos, mas não para. Estudos com ferramentas comerciais baseadas em RAG encontraram erro em parte relevante das respostas, inclusive respostas que citam uma fonte real que não sustenta o que foi dito. Por isso citação conferível e recusa quando não há fonte são obrigatórias.
Preciso de muitos documentos para usar RAG?
Não. Precisa de documentos certos, atualizados e sem versões conflitantes. Uma base pequena e bem cuidada costuma responder melhor do que uma pasta enorme com manuais antigos misturados aos vigentes.
Qual a diferença entre RAG e MCP?
RAG é a técnica de buscar trechos em documentos antes de responder. MCP é um protocolo para conectar o agente a sistemas e ferramentas, como banco de dados e ERP. Documento estável pede RAG; dado que muda o tempo todo pede consulta direta ao sistema.
Os documentos da empresa ficam expostos quando uso RAG?
Depende de como o sistema é montado. A permissão precisa ser aplicada na busca, para que cada pessoa só receba trechos que já poderia ler, e as regras de uso de dados do fornecedor de IA precisam ser lidas antes de subir documento sensível.
Onde a GoDEV entra
Fontes
Toda afirmação com marcação numérica no texto remete a um destes documentos. A data indica quando o conteúdo foi conferido contra a fonte.
- 1Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, Vladimir Karpukhin, Naman Goyal, Heinrich Küttler, Mike Lewis, Wen-tau Yih, Tim Rocktäschel, Sebastian Riedel, Douwe Kiela. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv (NeurIPS 2020), 2020. Acessar Consultado em 08/10/2026.
- 2Varun Magesh, Faiz Surani, Matthew Dahl, Mirac Suzgun, Christopher D. Manning, Daniel E. Ho. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. arXiv, 2024. Acessar Consultado em 08/10/2026.
- 3Scott Barnett, Stefanus Kurniawan, Srikanth Thudumu, Zach Brannelly, Mohamed Abdelrazek. Seven Failure Points When Engineering a Retrieval Augmented Generation System. arXiv, 2024. Acessar Consultado em 08/10/2026.
- 4Anthropic. Citations. Claude Platform Docs, 2026. Acessar Consultado em 08/10/2026.
- 5Google Cloud. Grounding overview. Google Cloud Documentation, 2026. Acessar Consultado em 08/10/2026.
- 6OpenAI. File search. OpenAI API Docs, 2026. Acessar Consultado em 08/10/2026.