"Por que o ChatGPT não sabe responder sobre meus produtos?" — porque o modelo foi treinado com dados públicos da internet até uma certa data, e nunca viu seu catálogo, seu FAQ interno, sua política de troca. A solução chama-se RAG, e desde o paper original do Facebook AI Research em 2020, virou padrão da indústria.
O que é RAG, sem enrolação
RAG significa Retrieval-Augmented Generation — "geração aumentada por busca". O fluxo é:
- Cliente pergunta algo no WhatsApp
- O sistema busca nos seus documentos os trechos mais relevantes
- Esses trechos são injetados no prompt junto com a pergunta
- O LLM responde usando esse contexto
Sem RAG, a IA "alucina" (inventa). Com RAG, ela responde baseada no que você escreveu.
Por que não basta colocar tudo no prompt
"Se a janela do GPT-4o aceita 128K tokens e Gemini 2.5 aceita 2M, por que não jogar todo meu manual lá?". Três motivos:
- Custo: você paga por token de entrada. Mandar 500 páginas a cada pergunta custa dezenas de centavos por interação.
- Latência: contextos grandes demoram mais pra processar.
- "Lost in the middle": estudos da Stanford (2023) mostram que LLMs esquecem informações no meio de contextos longos. Precisão cai em até 20%.
Como o RAG funciona por baixo
Fase 1: Indexação (uma vez)
- Você sobe documentos: PDFs, planilhas, transcrições, FAQ
- Sistema quebra em pedaços (chunks de ~500 palavras)
- Cada chunk é convertido em embedding (vetor de números que captura o significado)
- Embeddings são guardados em um banco vetorial (Pinecone, Weaviate, pgvector)
Fase 2: Consulta (toda mensagem)
- Pergunta do cliente vira embedding
- Busca por similaridade nos vetores indexados
- Top 3-5 chunks mais parecidos são recuperados
- Vão pro prompt:
"Responda usando apenas: [chunks]. Pergunta: [...]"
Exemplo prático: FAQ de uma loja
Sua loja tem 200 produtos. Cliente pergunta no WhatsApp: "a camiseta azul tem em GG?".
- Sem RAG: IA inventa "sim, temos!" — e a expectativa do cliente quebra
- Com RAG: sistema busca "camiseta azul" no catálogo, encontra ficha com tamanhos disponíveis, IA responde "Sim, temos a camiseta azul nos tamanhos M, G e GG. Quer reservar?"
Boas práticas de RAG em 2026
- Chunks bem dimensionados (300-800 tokens): pequeno demais perde contexto, grande demais polui
- Hybrid search: combinar busca vetorial (semântica) com busca por palavra-chave (BM25) eleva precisão em ~15%
- Re-ranking: passar os top 20 por um modelo de re-rank (como Cohere Rerank) e ficar com os 5 melhores
- Citações: peça pro LLM citar a fonte de cada afirmação — você detecta alucinação na hora
- Atualização contínua: documentos mudam. Re-indexe automaticamente quando o arquivo é atualizado
Quando RAG NÃO resolve
- Quando a resposta depende de cálculo ou raciocínio (use function calling)
- Quando os dados são tabulares e estruturados (banco SQL é melhor)
- Quando você precisa que a IA aprenda permanentemente (use fine-tuning)
No GestPro System, o RAG é automático: arraste seus PDFs, planilhas e FAQs, e a IA começa a responder com base neles em minutos — sem código, sem banco vetorial pra configurar.
Pronto para colocar tudo isso em prática?
GestPro System reúne CRM Kanban, IA (GPT + Gemini), automações no-code e WhatsApp em um só painel.
Ver planos a partir de R$ 47/mês →