Como o ChatGPT escolhe as fontes que cita?

Quando precisa de informação atual, o ChatGPT reformula a pergunta em consultas de busca, recupera candidatos do índice do Bing, lê o HTML das páginas mais promissoras e seleciona 3 a 5 fontes para sintetizar a resposta com citações. Nessa seleção, ganham páginas com resposta direta no topo, alta densidade factual, estrutura semântica clara e autoria verificável; perdem PDFs e páginas dependentes de JavaScript, que o crawler não lê. Este artigo detalha as cinco etapas do processo, os cinco fatores que decidem a escolha e o que muda entre ChatGPT, Perplexity, Gemini e Claude.

Qual é o caminho da pergunta até a resposta?

Entre o momento em que alguém digita "quais gestoras têm as melhores análises sobre juros?" e o momento em que a resposta aparece com três links citados, existem cinco etapas. Entender cada uma é o que separa quem otimiza no lugar certo de quem otimiza no escuro.

AS CINCO ETAPAS DO RETRIEVAL
ETAPA O QUE ACONTECE O QUE DECIDE
1 · Reformulação A pergunta do usuário vira uma ou mais consultas de busca Cobrir o vocabulário que os usuários realmente usam
2 · Retrieval Os candidatos vêm do índice do Bing Estar indexado (Bing Webmaster Tools, IndexNow)
3 · Leitura O sistema baixa e lê o HTML das páginas candidatas Conteúdo no HTML inicial, sem depender de JavaScript
4 · Seleção 3 a 5 fontes entram na resposta final Resposta direta, fatos com fonte, autoridade verificável
5 · Síntese O modelo escreve a resposta citando as selecionadas Trechos extraíveis e sem ambiguidade

Fonte: documentação da OpenAI sobre ChatGPT Search e análises de retrieval, 2025–2026.

Por que a etapa 1 derruba tanta gente

A pergunta que o investidor faz raramente é a consulta que o sistema executa. "Vale a pena investir em NTN-B agora?" pode virar três buscas distintas sobre juro real, inflação implícita e título público. Uma página escrita só para a palavra-chave "NTN-B" cobre uma dessas consultas; uma página que explica o conceito, o contexto e a decisão cobre as três. É por isso que otimizar para termo isolado rende menos do que responder a pergunta inteira.

Por que a etapa 2 é a mais negligenciada

O ChatGPT não tem um índice próprio da web para busca em tempo real: ele usa o do Bing. Uma gestora pode ter o melhor conteúdo do país e nunca ser recuperada simplesmente porque nunca cadastrou o domínio no Bing Webmaster Tools. É um passo gratuito, que leva minutos, e que a maior parte do mercado financeiro brasileiro não deu.

Por que a etapa 3 elimina a maioria das gestoras

Nesta etapa o sistema baixa o HTML e lê o que está ali. Não abre o navegador, não executa scripts, não espera componentes carregarem. Se o texto aparece só depois que o JavaScript roda, o que chega ao modelo é uma casca vazia. E se o conteúdo está dentro de um PDF, o custo de extração é alto e a estrutura se perde. Os dois modos de invisibilidade estão detalhados em por que as IAs não leem PDF.

O que decide a escolha entre as páginas que sobraram?

Chegando à etapa 4, o sistema tem um punhado de candidatas legíveis e precisa escolher três a cinco. A ReBo organiza os critérios dessa escolha em cinco fatores, cada um decomposto em variáveis concretas. É a lista de verificação que separa o conteúdo citado do conteúdo invisível.

OS CINCO FATORES E SUAS VARIÁVEIS
FATOR VARIÁVEL O QUE MEDIR OU APLICAR
1 · Formato legível Tipo de página Conteúdo em página HTML indexável, não PDF, não imagem, não atrás de login
Texto selecionável Texto real no DOM, copiável, não rasterizado nem dentro de <canvas>
Renderização Conteúdo no HTML servido, não injetado só por JavaScript pesado
URL única e estável Cada conteúdo com URL própria, permanente e descritiva
Robots e indexação meta robots index,follow; sem bloqueio no robots.txt; presente no sitemap
Peso e acesso Página leve, sem paywall nem popup na frente do conteúdo
2 · Estrutura semântica Hierarquia de títulos Um H1, H2 e H3 em ordem lógica descrevendo cada seção
Cabeçalhos como perguntas Subtítulos no formato da pergunta do usuário
Blocos autossuficientes Cada seção responde sozinha, sem depender do parágrafo anterior
Índice navegável Sumário com âncoras para cada seção
Listas e tabelas Dados em <ul>, <ol> e <table> reais, nunca em imagem
FAQ estruturado Bloco de perguntas e respostas ao final, com schema FAQPage
Parágrafos curtos Ideias em blocos diretos, fáceis de extrair como trecho
3 · Metadados Title e meta description Únicos, descritivos, com o conceito central
Autor identificado Nome real do gestor ou analista, cargo e página de bio
Datas visíveis Data de publicação e de atualização explícitas
Open Graph e Twitter Card og:title, og:description, og:image preenchidos
Schema.org (JSON-LD) Marcação Article, FAQPage, Organization, Person
Canonical Apontando para a URL definitiva, evitando duplicidade
Sinais institucionais Quem somos, CNPJ, registro CVM ou ANBIMA, contato, compliance
4 · Densidade de dados Números com unidade Valores precisos com %, R$, US$ ou pontos, não "subiu bastante"
Datas dos dados Cada dado ancorado a um período
Fontes primárias citadas Origem nomeada (IBGE, BCB, Tesouro, Focus) dentro do texto
Afirmações verificáveis Frases factuais e atribuíveis, fáceis de citar com segurança
Definição de termos Conceitos técnicos explicados no próprio texto
Tabelas de dados Séries e comparativos em tabela legível por máquina
5 · Evergreen e malha Conteúdo atemporal Páginas-pilar sobre temas perenes
Links internos temáticos Cada artigo linka de 3 a 6 conteúdos relacionados do próprio site
Pilares e clusters Um guia central conectado a artigos satélite do mesmo tema
Atualização recorrente Conteúdo revisado periodicamente, com data nova
Cobertura consistente Volume e regularidade sobre o mesmo domínio de conhecimento
Menções externas Ser citado por outros sites e pela imprensa reforça a autoridade

Fonte: framework de fatores de citação ReBo, junho de 2026.

Fator 1: por que o formato decide antes do mérito?

Este é o fator eliminatório. Antes de avaliar se a sua análise é boa, o sistema precisa conseguir lê-la. Um PDF é um fluxo de bytes desenhado para impressão: instruções de posicionamento de texto, fontes embutidas, tabelas que viram células soltas sem cabeçalho nem unidade. A hierarquia que o humano enxerga existe apenas como tamanho de fonte, não como estrutura.

O teste é o mais simples que existe e não exige nenhuma ferramenta: abra a página, use "exibir código-fonte" e procure o texto. Se ele não está lá, ele não existe para a IA. Vale para conteúdo em PDF, para sites renderizados por JavaScript, para texto dentro de imagem e para qualquer coisa atrás de login ou formulário.

Fator 2: o que estrutura semântica muda na prática?

Estrutura é o que permite ao modelo extrair um trecho e citá-lo com confiança. Um bloco de texto corrido de dois mil caracteres pode conter a melhor resposta do mercado, mas o sistema precisa decidir onde ela começa e onde termina, e essa ambiguidade custa a citação.

O recurso mais subestimado aqui é o cabeçalho em forma de pergunta. Um H2 que diz "Cenário macro" descreve um assunto. Um H2 que diz "Por que o déficit não cede?" é uma correspondência quase literal com a consulta que o sistema acabou de formular na etapa 1. A segunda forma vence com regularidade, e o custo de adotá-la é zero.

O segundo recurso é o parágrafo autossuficiente. Textos escritos para leitura linear usam "como vimos acima" e "conforme mencionado". Para recuperação, cada parágrafo precisa fazer sentido isolado, porque é isolado que ele vai ser lido. Retomar o sujeito em vez de referenciá-lo custa cinco palavras e preserva o trecho como unidade citável.

Fator 3: por que metadados valem mais em conteúdo financeiro?

Metadados respondem quem escreveu, quando e sobre o quê, sem que o modelo precise inferir. Em conteúdo financeiro isso pesa mais do que em outros setores, porque a resposta errada tem consequência: sistemas de recuperação tendem a ser conservadores em temas de dinheiro, saúde e direito, e preferem fontes cuja autoria e data conseguem verificar.

Na prática, isso significa nome real do gestor com cargo e página de bio, e não "Equipe de Análise". Significa data de publicação e de atualização visíveis. Significa JSON-LD marcando Article, FAQPage, Organization e Person. E, para instituição regulada, significa expor os sinais que o mercado espera: quem somos, CNPJ, registro na CVM ou ANBIMA, canal de contato e compliance.

Fator 4: o que é densidade factual e por que ela decide?

Densidade factual é a proporção de afirmações verificáveis por parágrafo. "A inflação cedeu" é uma opinião comprimida. "O IPCA-15 de maio veio a 0,62%, segundo o IBGE" é um fato com número, unidade, período e fonte primária, e o modelo consegue citá-lo sem assumir risco.

É a diferença entre ser lido e ser citado. Uma página pode ser perfeitamente legível e nunca aparecer numa resposta porque não oferece nada que valha a pena reproduzir. Quatro elementos aumentam essa densidade de forma imediata: número com unidade, data do dado, fonte nomeada dentro do texto e definição explícita dos termos técnicos usados.

Quanto maior a densidade factual, mais citável o conteúdo. Por isso cada bloco preserva números, datas e entidades nomeadas com fonte.
— Método ReBo, princípio de estruturação

Fator 5: por que uma página isolada raramente é citada?

Os quatro primeiros fatores tratam da página. O quinto trata do domínio. Sistemas de recuperação avaliam se aquele site é uma fonte recorrente sobre o assunto ou uma aparição isolada, e isso se constrói com cobertura consistente, malha interna e menções externas.

Malha interna significa que cada artigo aponta para 3 a 6 conteúdos relacionados do próprio site, formando pilares e clusters em torno de um tema. Menções externas significam ser citado fora do próprio domínio: imprensa, comunidades, agregadores. A frequência de citação por IA correlaciona com menções da marca fora do site, e é por isso que publicar bem sem distribuir raramente move o ponteiro.

Como isso aparece no mercado brasileiro hoje?

Em junho de 2026 a ReBo analisou três casas do mercado brasileiro para observar o padrão. Duas delas publicam análises em página web estruturada e apareceram citadas pelo ChatGPT em perguntas sobre cenário. A terceira produz um conteúdo mensal de qualidade comparável, com análise fiscal densa, dados e fontes primárias, mas publicado como PDF numa lista de links.

O material da terceira casa não perdeu por mérito. Perdeu nos cinco fatores ao mesmo tempo: o conteúdo estava dentro de um PDF, sem hierarquia HTML nem âncoras, numa página de listagem sem title descritivo, sem autor, sem data e sem schema por edição, com dados excelentes porém presos ao arquivo, e sem nenhuma interligação temática entre edições. É o retrato do Nível 1 do framework de AI Visibility: invisível para IA.

A conclusão prática é incômoda e libertadora ao mesmo tempo. A disputa pelas três a cinco citações de cada resposta não está sendo vencida por quem tem a melhor análise, e sim por quem tem a análise legível. Isso significa que uma casa menor com conteúdo bem estruturado passa na frente de uma casa grande com tudo em PDF.

Como escrever um parágrafo que a IA consegue citar?

A regra prática é escrever para alguém que vai ler exatamente um parágrafo do seu texto, fora de contexto, e precisa decidir se pode reproduzi-lo. Cerca de 44% das citações vêm dos primeiros 30% do texto, então a resposta completa precisa estar no topo, não construída ao longo da página.

O MESMO CONTEÚDO, ESCRITO DE DUAS FORMAS
VERSÃO QUE NÃO É CITADA VERSÃO CITÁVEL
Afirmação "A inflação surpreendeu para baixo no mês." "O IPCA-15 de maio veio a 0,62%, abaixo da mediana do Focus, segundo o IBGE."
Referência "Como vimos acima, isso muda o cenário." "A desaceleração do IPCA-15 muda o cenário de juros para o segundo semestre."
Cabeçalho "Cenário macro" "Por que a inflação cedeu em maio?"
Dado "O câmbio se valorizou bastante." "O real valorizou 3,1% frente ao dólar no mês, fechando a R$ 5,16."
Termo técnico "Aumentamos duration." "Aumentamos duration, ou seja, a sensibilidade da carteira a variações de juros."

Fonte: diretrizes de redação AI-friendly ReBo, 2026. Os números são ilustrativos do formato, não recomendação.

Repare que a versão citável não é mais longa nem mais técnica. Ela apenas não deixa nada implícito: cada frase carrega o sujeito, o número, a unidade, o período e a fonte que a tornam verificável sozinha.

Perplexity, Gemini e Claude escolhem do mesmo jeito?

O processo geral é semelhante em todas: buscar, ranquear candidatos, sintetizar com citação. O que muda é de onde vêm os candidatos e quantas fontes entram na resposta, e isso tem consequência prática sobre onde investir esforço de indexação.

O QUE MUDA ENTRE OS MOTORES
MOTOR DE ONDE VÊM OS CANDIDATOS CONSEQUÊNCIA PRÁTICA
ChatGPT Índice do Bing Cadastrar o domínio no Bing Webmaster Tools é pré-requisito, não detalhe
Perplexity Índice próprio, com crawler dedicado Costuma citar mais fontes por resposta; liberar o PerplexityBot importa
Gemini Índice do Google Search Console e as boas práticas de indexação do Google seguem valendo
Claude Busca integrada com crawler próprio Exige HTML estático; o ClaudeBot não executa JavaScript
Copilot Ecossistema Microsoft e índice do Bing Compartilha com o ChatGPT o mesmo gargalo de indexação

Fonte: mapeamento de motores ReBo, 2026.

A leitura correta dessa tabela é que os fundamentos não mudam. HTML legível, estrutura semântica, densidade factual e autoria verificável valem para os cinco. O que varia é o canal de indexação, e por isso o diagnóstico mede os cinco motores separadamente em vez de tratar "a IA" como uma coisa só.

O que elimina uma página da disputa?

Ser ilegível é o principal, e já foi tratado no Fator 1. Mas há três formas de eliminação que acontecem por descuido de configuração, não por escolha de formato, e que costumam passar despercebidas por meses.

Vale a distinção: nenhum desses três é problema de conteúdo. São decisões de infraestrutura que anulam meses de produção editorial, e por isso a auditoria técnica precede a produção no método ReBo.

Como saber se você está sendo citado?

A citação por IA não é determinística. A mesma pergunta gera fontes diferentes em execuções distintas, porque o sistema reformula a consulta e reavalia candidatos a cada rodada. Isso inviabiliza medir por resposta isolada e exige medir por frequência.

O método é definir um conjunto de perguntas-alvo, tipicamente de 30 a 80, que clientes, alocadores, jornalistas e consultores realmente fazem sobre o seu mercado, e testá-las nos cinco motores em cadência fixa. A métrica resultante é a taxa de citação: em que porcentagem dessas perguntas a instituição aparece. Medida contra uma baseline, ela mostra movimento; medida uma vez, não mostra nada.

Dois sinais complementares confirmam a leitura. O primeiro são os logs do servidor: hits de GPTBot, ClaudeBot e PerplexityBot são a prova concreta de que os robôs estão lendo. O segundo é o tráfego de referência vindo das plataformas de IA, que mostra o efeito humano da citação.

Para descobrir onde a sua casa está nessa disputa hoje, o diagnóstico ReBo mede as respostas reais dos cinco motores e registra quem aparece no seu lugar.

Perguntas frequentes

Preciso estar indexado no Bing para ser citado pelo ChatGPT?

Na prática, sim. A busca do ChatGPT usa o índice do Bing como base de retrieval, e o Copilot compartilha o mesmo ecossistema. Cadastrar o site no Bing Webmaster Tools e ativar o IndexNow acelera a indexação. É gratuito, leva minutos e é um dos passos mais esquecidos pelo mercado financeiro brasileiro.

Por que a mesma pergunta gera fontes diferentes a cada vez?

Porque a seleção não é determinística: o modelo reformula a consulta e reavalia os candidatos a cada execução. Por isso a visibilidade se mede em taxa de citação ao longo de várias rodadas e de um conjunto de perguntas-alvo, nunca em uma resposta isolada.

Perplexity e Gemini escolhem fontes do mesmo jeito?

O processo geral é semelhante, mas cada plataforma tem índice e critérios próprios: o Perplexity mantém índice próprio e costuma citar mais fontes por resposta, e o Gemini parte do índice do Google. Os fundamentos, HTML legível, estrutura semântica, densidade factual e autoria verificável, valem para todas.

Conteúdo novo tem chance contra sites grandes?

Sim. As IAs citam a página que melhor responde a pergunta específica, não a marca maior. Páginas nichadas, com resposta direta e dados próprios, vencem portais genéricos com frequência, especialmente em perguntas de cauda longa. Como quase todo o setor financeiro está em PDF, a disputa está praticamente vazia.

Quantas fontes o ChatGPT cita por resposta?

Tipicamente de 3 a 5 quando faz busca em tempo real. É um número pequeno, e é o que torna a disputa relevante: não existe segunda página de resultados para disputar, existem três a cinco vagas por pergunta.

Dados estruturados sozinhos fazem a IA me citar?

Não. JSON-LD ajuda a máquina a extrair autor, data, pergunta e resposta sem ambiguidade, o que remove atrito na etapa de leitura. Mas ele não substitui conteúdo legível, denso e com fonte. Schema em cima de página vazia continua sendo página vazia.

Quanto tempo leva para uma página nova ser citada?

Crawlers como GPTBot e PerplexityBot revisitam sites ativos em dias ou semanas, então a leitura costuma acontecer rápido. A citação consistente depende de volume, atualização e sinais externos, e por isso se constrói ao longo de meses, não de uma publicação.

Continue por aqui

Para os dois modos de invisibilidade em detalhe, veja por que as IAs não leem PDF. Para a disciplina que trabalha esses fatores, o que é GEO e GEO vs SEO. Para o conceito guarda-chuva, o que é AI Visibility. Para o recorte do mercado financeiro, AI Visibility para gestoras. Os termos técnicos deste artigo estão definidos em crawler de IA, dados estruturados, E-E-A-T e taxa de citação.