O que é retrieval (recuperação) em busca com IA?

Retrieval, ou recuperação, é a etapa em que o sistema localiza e seleciona as fontes que vão sustentar a resposta, antes de escrever uma única palavra. É a arquitetura conhecida como RAG, sigla de geração aumentada por recuperação. Para quem quer ser citado, é a etapa que importa: o que não é recuperado não pode ser citado, por melhor que seja.

O que acontece dentro do retrieval

O sistema reformula a pergunta do usuário, normalmente decompondo-a em várias sub-buscas (o query fan-out), consulta um índice, próprio ou de um buscador parceiro, e traz um conjunto de documentos candidatos. Esses candidatos passam então por uma reordenação, que pondera aderência ao trecho buscado, confiabilidade da fonte, atualidade e clareza da extração.

Só depois disso o modelo escreve. A resposta é redigida a partir dos trechos selecionados, e as citações apontam para os documentos que sobreviveram à seleção. Isso significa que há duas disputas encadeadas: entrar no conjunto de candidatos e vencer a reordenação.

O que faz uma página vencer o retrieval

Estar indexada e acessível ao crawler é pré-requisito: página dependente de JavaScript ou PDF sem camada de texto raramente chega ao conjunto de candidatos. Depois, vale o que facilita a extração: um bloco que responde à sub-pergunta de forma autocontida, com números, datas e entidades nomeadas no mesmo lugar em que está a afirmação.

Por fim, os sinais de confiança: autoria nomeada e verificável, data de atualização visível, coerência entre o que a página diz e o que outras fontes dizem sobre a mesma entidade, e sinal externo apontando para o domínio. Entre dois blocos igualmente legíveis, é isso que desempata.

Verbetes relacionados

O retrieval opera sobre o query fan-out e é o que os crawlers de IA alimentam. Veja em detalhe como o ChatGPT escolhe as fontes que cita.

Perguntas frequentes

Toda resposta de IA passa por retrieval?

Não. Respostas que o modelo produz apenas com o que aprendeu no treino não recuperam nada e normalmente não trazem citação. Quando há links na resposta, houve recuperação.

De qual índice as IAs recuperam?

Varia por produto e muda com frequência: alguns usam índice próprio, outros licenciam o índice de um buscador, e vários combinam as duas coisas. Por isso a medição da ReBo é feita motor a motor, sem supor um índice comum.

Dá para forçar a recuperação de uma página?

Não. Dá para remover os obstáculos (acesso liberado no robots.txt e no CDN, HTML estático, estrutura extraível) e aumentar os sinais de confiança. O que o sistema faz com isso não é controlável, e por isso não prometemos citação.