Como os registros de bate-papo privado da IA ​​vazaram: por que o Google e o Bing indexaram links públicos de Claude

Você acha que suas conversas com uma IA permanecem privadas.

Eles nem sempre.

Basta perguntar às pessoas que assistiram às suas conversas íntimas ou politicamente carregadas com Claude da Anthropic que aparecem nos resultados de pesquisa do Google e do Bing neste fim de semana. A descoberta não foi sutil. Tudo começou quando um Redditor percebeu que URLs específicos – destinados ao compartilhamento de “instantâneos” de bate-papo – estavam abertos.

Não foram apenas bate-papos quaisquer. Eles incluíam usuários que pediam conselhos sobre filiação a partidos políticos. Perguntas jurídicas dos advogados do Kansas sobre se eles devem denunciar violações éticas. E sim, cenários eróticos de dramatização.

Se você valoriza a privacidade na era da IA ​​generativa, esta é uma lição crítica sobre como a mecânica da web anula as boas intenções.

O equívoco do Robots.txt

Esta é a realidade técnica que a maioria dos usuários – e muitas vezes as empresas que criam essas ferramentas – não percebe.

A Anthropic usa um arquivo robots.txt para informar aos rastreadores dos mecanismos de pesquisa para ficarem longe de URLs de bate-papo compartilhados. Este arquivo está em vigor desde pelo menos setembro de 2024 (o texto original citava 2025, o que é provavelmente um erro ou erro de digitação futuro para o cronograma atual, mas o mecanismo permanece o mesmo). robots.txt é o padrão da indústria para dizer: “Não raspe esta parte do site.”

Funciona na maioria das vezes.

Não é uma parede. É um pedido educado.

Mecanismos de busca como Google e Bing estão programados para ignorar o robots.txt se encontrarem um link para uma página em outro lugar na Internet. Se alguém criar um link para aquele instantâneo “público” de Claude em um fórum, um e-mail ou uma postagem em mídia social, o mecanismo de busca o rastreará de qualquer maneira.

Para realmente interromper a indexação, os desenvolvedores precisam usar uma tag HTML específica.

Por que “Noindex” estava faltando

De acordo com a WIRED, os bate-papos vazados não tinham a meta tag noindex.

Tanto o Google quanto o Bing exigem esta diretiva explícita. Se uma página não tiver a tag noindex (ou uma x-robots-tag no cabeçalho HTTP), os mecanismos de pesquisa presumem que o webmaster deseja que essa página seja indexada e exibida nos resultados de pesquisa.

“Nem o Google nem qualquer outro mecanismo de busca controla o que é tornado público na web… Damos aos proprietários de sites controles claros… e sempre respeitamos essas diretivas.”

Esta é uma postura defensável de um mecanismo de pesquisa. É menos defensável do lado da Antrópico, principalmente porque eles enfrentaram o mesmo calor em setembro passado.

O porta-voz do Google, Ned Adriance, disse à WIRED que a indexação cabe ao proprietário do site. Os links de bate-papo são públicos por design. Se a URL estiver acessível, ela será indexável.

A Microsoft não comentou. Antrópico não respondeu.

A lacuna entre privacidade e indexação

A questão central aqui não é a intenção maliciosa. É uma colisão de recursos.

Claude permite que os usuários gerem URLs públicos para compartilhar conversas. Isso é útil para colaboração. Mas a geração de um URL público aciona um comportamento padrão de indexação da Web, a menos que seja explicitamente bloqueado em um nível mais profundo.

A maioria dos usuários presume que “compartilhado” significa “apenas link privado”. Isso não acontece. No mundo do SEO, “URL público” é igual a “resultado de pesquisa potencial”.

Isso aconteceu com o Bing, que ainda mostrou cerca de 612 resultados para site:claude.ai/share quando relatado. Os resultados do Google para a consulta específica de “compartilhamento” parecem ter sido esclarecidos depois que a WIRED os revisou, provavelmente depois que os links foram excluídos ou atualizados.

Mas os dados estão aí. Existem cópias em cache. A lição é dura para qualquer pessoa que usa chatbots de IA para tópicos delicados:

  1. Suponha que nada seja verdadeiramente privado.
  2. URLs públicos são indexáveis por padrão, a menos que proteções técnicas sejam implementadas corretamente.
  3. robots.txt não é suficiente. Você precisa de noindex.

Os laboratórios de IA afirmam que respeitam as regras do rastreador. Eles fazem. Mas eles contam com os desenvolvedores para usar as regras corretas. Se a implementação for falha, seu histórico de dramatização erótica acabará na página de resultados de um mecanismo de pesquisa.

E você não pode desmarcar o Google.

A implicação mais ampla? À medida que os agentes de IA se tornam mais integrados na vida quotidiana – desde fluxos de trabalho controlados por smartphones até à utilização de tokens governamentais – a superfície de ataque para fugas de privacidade aumenta. Estamos construindo sistemas que nos respondem, enquanto a web aberta indexa todas as conversas.

Quem controla o índice? Quem é o dono da memória?

Provavelmente não você.

попередня статтяFrança enfrenta históricas nuvens pirocumulonimbus em meio a incêndios florestais sem precedentes