Jak unikly soukromé protokoly chatu s umělou inteligencí: proč Google a Bing indexovaly Claudeovy veřejné odkazy

Myslíte si, že vaše konverzace s umělou inteligencí zůstávají soukromé.

Ale není tomu tak vždy.

Jen se zeptejte těch, kteří viděli jejich intimní nebo politicky nabité konverzace s Anthropic’s Claude o víkendu ve výsledcích vyhledávání Google a Bing. V žádném případě se nejedná o skrytý únik. Všechno to začalo, když si jeden uživatel Redditu všiml, že konkrétní adresy URL určené pro sdílení „snímků“ chatů jsou ve veřejné doméně.

Nešlo jen o nějakou korespondenci. Byli mezi nimi uživatelé, kteří žádali o radu na základě své politické příslušnosti. Kansaští právníci položili právní otázky, zda mají povinnost hlásit svá vlastní etická porušení. A ano, byly tam erotické scénáře hraní rolí.

Pokud si ceníte soukromí ve věku generativní umělé inteligence, je to důležitá lekce o tom, jak mechanika webové technologie trumfuje dobré úmysly.

Mýtus o Robots.txt

Zde je technická realita, která je nejčastěji přehlížena jak uživateli, tak často i samotnými společnostmi, které tyto nástroje vyvíjejí.

Anthropic používá soubor robots.txt, aby řekl prohledávačům, aby nenavštěvovali obecné odkazy na chat. Tento soubor existuje minimálně od září 2024 (robots.txt je průmyslovým standardem pro zprávu: „Neprocházet tuto část webu“).

Nejčastěji to funguje.

Ale tohle není zeď. To je jen zdvořilý požadavek.

Vyhledávače jako Google a Bing jsou naprogramovány tak, aby ignorovaly robots.txt, pokud najdou odkaz na stránku někde jinde na internetu. Pokud někdo zveřejní odkaz na tuto „veřejnou“ fotku Clauda na fóru, e-mailu nebo sociální síti, vyhledávač jej přesto zaindexuje.

Aby vývojáři skutečně zakázali indexování, musí použít speciální značku HTML.

Proč chyběl „Noindex“?

Podle WIRED unikly chaty, které postrádaly metaznačku noindex.

Google i Bing toto explicitní označení vyžadují. Pokud stránka nemá značku noindex (nebo hlavičku HTTP x-robots-tag ), vyhledávače předpokládají, že vlastník webu chce, aby byla stránka indexována a aby se zobrazila ve výsledcích vyhledávání.

„Google ani žádný jiný vyhledávač nekontroluje, co je veřejně publikováno na internetu… Vlastníkům stránek poskytujeme jasné kontroly… a vždy tyto pokyny respektujeme.“

Pro vyhledávač je tato pozice zcela oprávněná. Zdá se však, že ze strany Anthropic je méně bezpečná, zvláště když už loni na podzim čelili podobným problémům.

Mluvčí Google Ned Adrians řekl WIRED, že rozhodnutí o indexování spočívá na vlastníkovi webu. Odkazy na chaty jsou veřejné. Pokud je adresa URL k dispozici, lze ji indexovat.

Microsoft se k situaci nevyjádřil. Antropická nereagovala.

Propast mezi soukromím a indexováním

Klíčovým problémem zde není zlý úmysl. Jedná se o střet funkcí.

Claude umožňuje uživatelům vytvářet veřejné odkazy pro sdílení konverzace. To je výhodné pro spolupráci. Ale generování veřejného odkazu automaticky spouští standardní chování při indexování webu, pokud není explicitně blokováno na hlubší úrovni.

Většina uživatelů si myslí, že „sdílený“ znamená „soukromý odkaz“. To je špatně. Ve světě optimalizace pro vyhledávače (SEO) znamená „veřejná adresa URL“ „potenciální výsledek vyhledávání“.

To se stalo s Bingem, který v době publikace stále zobrazoval asi 612 výsledků pro dotaz site:claude.ai/share. Výsledky Google pro konkrétní dotaz „sdílet“ byly vymazány, pravděpodobně poté, co je redaktoři WIRED zkontrolovali, pravděpodobně odstranili nebo aktualizovali odkazy.

Data už jsou ale online. Existují kopie uložené v mezipaměti. Lekce je příliš drsná na to, aby kdokoli, kdo používá chatboty AI, diskutoval o citlivých tématech:

  1. Nedůvěřujte ničemu jako absolutnímu soukromí.
  2. Veřejné adresy URL jsou ve výchozím nastavení indexovány, pokud nejsou implementovány správné technické ochrany.
  3. robots.txt nestačí. Potřebujete značku noindex.

Laboratoře umělé inteligence tvrdí, že respektují pravidla pro roboty. A opravdu to dělají. Spoléhají ale na to, že vývojáři použijí správná pravidla. Pokud je implementace chybná, váš erotický příběh o hraní rolí skončí na stránce s výsledky vyhledávače.

A nemůžete to zrušit z Googlu.

Co je širší? S tím, jak se agenti umělé inteligence více začleňují do každodenního života – od automatizace pracovních postupů na chytrých telefonech po používání vládních tokenů – se plocha pro úniky soukromí rozšiřuje. Vytváříme systémy, které na nás reagují v dialogu, zatímco otevřený web indexuje každou konverzaci.

Kdo řídí index? Kdo je vlastníkem paměti?

Vy s největší pravděpodobností ne.

попередня статтяFrancie čelí historické bouři zrozené z ohně: bezprecedentní požáry