O que é retrieval (recuperação) em busca com IA?
Retrieval, ou recuperação, é a etapa em que o sistema localiza e seleciona as fontes que vão sustentar a resposta, antes de escrever uma única palavra. É a arquitetura conhecida como RAG, sigla de geração aumentada por recuperação. Para quem quer ser citado, é a etapa que importa: o que não é recuperado não pode ser citado, por melhor que seja.
O que acontece dentro do retrieval
O sistema reformula a pergunta do usuário, normalmente decompondo-a em várias sub-buscas (o query fan-out), consulta um índice, próprio ou de um buscador parceiro, e traz um conjunto de documentos candidatos. Esses candidatos passam então por uma reordenação, que pondera aderência ao trecho buscado, confiabilidade da fonte, atualidade e clareza da extração.
Só depois disso o modelo escreve. A resposta é redigida a partir dos trechos selecionados, e as citações apontam para os documentos que sobreviveram à seleção. Isso significa que há duas disputas encadeadas: entrar no conjunto de candidatos e vencer a reordenação.
O que faz uma página vencer o retrieval
Estar indexada e acessível ao crawler é pré-requisito: página dependente de JavaScript ou PDF sem camada de texto raramente chega ao conjunto de candidatos. Depois, vale o que facilita a extração: um bloco que responde à sub-pergunta de forma autocontida, com números, datas e entidades nomeadas no mesmo lugar em que está a afirmação.
Por fim, os sinais de confiança: autoria nomeada e verificável, data de atualização visível, coerência entre o que a página diz e o que outras fontes dizem sobre a mesma entidade, e sinal externo apontando para o domínio. Entre dois blocos igualmente legíveis, é isso que desempata.
Verbetes relacionados
O retrieval opera sobre o query fan-out e é o que os crawlers de IA alimentam. Veja em detalhe como o ChatGPT escolhe as fontes que cita.
Perguntas frequentes
Toda resposta de IA passa por retrieval?
Não. Respostas que o modelo produz apenas com o que aprendeu no treino não recuperam nada e normalmente não trazem citação. Quando há links na resposta, houve recuperação.
De qual índice as IAs recuperam?
Varia por produto e muda com frequência: alguns usam índice próprio, outros licenciam o índice de um buscador, e vários combinam as duas coisas. Por isso a medição da ReBo é feita motor a motor, sem supor um índice comum.
Dá para forçar a recuperação de uma página?
Não. Dá para remover os obstáculos (acesso liberado no robots.txt e no CDN, HTML estático, estrutura extraível) e aumentar os sinais de confiança. O que o sistema faz com isso não é controlável, e por isso não prometemos citação.