← Voltar para o blog
Inteligência Artificial

RAG explicado: como dar contexto da sua empresa para a IA responder

🔍

"Por que o ChatGPT não sabe responder sobre meus produtos?" — porque o modelo foi treinado com dados públicos da internet até uma certa data, e nunca viu seu catálogo, seu FAQ interno, sua política de troca. A solução chama-se RAG, e desde o paper original do Facebook AI Research em 2020, virou padrão da indústria.

O que é RAG, sem enrolação

RAG significa Retrieval-Augmented Generation — "geração aumentada por busca". O fluxo é:

  1. Cliente pergunta algo no WhatsApp
  2. O sistema busca nos seus documentos os trechos mais relevantes
  3. Esses trechos são injetados no prompt junto com a pergunta
  4. O LLM responde usando esse contexto

Sem RAG, a IA "alucina" (inventa). Com RAG, ela responde baseada no que você escreveu.

Por que não basta colocar tudo no prompt

"Se a janela do GPT-4o aceita 128K tokens e Gemini 2.5 aceita 2M, por que não jogar todo meu manual lá?". Três motivos:

  • Custo: você paga por token de entrada. Mandar 500 páginas a cada pergunta custa dezenas de centavos por interação.
  • Latência: contextos grandes demoram mais pra processar.
  • "Lost in the middle": estudos da Stanford (2023) mostram que LLMs esquecem informações no meio de contextos longos. Precisão cai em até 20%.

Como o RAG funciona por baixo

Fase 1: Indexação (uma vez)

  1. Você sobe documentos: PDFs, planilhas, transcrições, FAQ
  2. Sistema quebra em pedaços (chunks de ~500 palavras)
  3. Cada chunk é convertido em embedding (vetor de números que captura o significado)
  4. Embeddings são guardados em um banco vetorial (Pinecone, Weaviate, pgvector)

Fase 2: Consulta (toda mensagem)

  1. Pergunta do cliente vira embedding
  2. Busca por similaridade nos vetores indexados
  3. Top 3-5 chunks mais parecidos são recuperados
  4. Vão pro prompt: "Responda usando apenas: [chunks]. Pergunta: [...]"

Exemplo prático: FAQ de uma loja

Sua loja tem 200 produtos. Cliente pergunta no WhatsApp: "a camiseta azul tem em GG?".

  • Sem RAG: IA inventa "sim, temos!" — e a expectativa do cliente quebra
  • Com RAG: sistema busca "camiseta azul" no catálogo, encontra ficha com tamanhos disponíveis, IA responde "Sim, temos a camiseta azul nos tamanhos M, G e GG. Quer reservar?"

Boas práticas de RAG em 2026

  1. Chunks bem dimensionados (300-800 tokens): pequeno demais perde contexto, grande demais polui
  2. Hybrid search: combinar busca vetorial (semântica) com busca por palavra-chave (BM25) eleva precisão em ~15%
  3. Re-ranking: passar os top 20 por um modelo de re-rank (como Cohere Rerank) e ficar com os 5 melhores
  4. Citações: peça pro LLM citar a fonte de cada afirmação — você detecta alucinação na hora
  5. Atualização contínua: documentos mudam. Re-indexe automaticamente quando o arquivo é atualizado

Quando RAG NÃO resolve

  • Quando a resposta depende de cálculo ou raciocínio (use function calling)
  • Quando os dados são tabulares e estruturados (banco SQL é melhor)
  • Quando você precisa que a IA aprenda permanentemente (use fine-tuning)

No GestPro System, o RAG é automático: arraste seus PDFs, planilhas e FAQs, e a IA começa a responder com base neles em minutos — sem código, sem banco vetorial pra configurar.

Pronto para colocar tudo isso em prática?

GestPro System reúne CRM Kanban, IA (GPT + Gemini), automações no-code e WhatsApp em um só painel.

Ver planos a partir de R$ 47/mês →

Fontes consultadas