Приватні чати Клода оприлюднені в результатах пошуку Google і Bing

Як приватні логи чату з ІІ втекли: чому Google і Bing проіндексували публічні посилання Claude

Ви думаєте, що ваші розмови зі штучним інтелектом залишаються приватними.

Але це завжди так.

Достатньо звернутися до тих, хто у вихідні побачив свої інтимні чи політично гострі діалоги з Claude від Anthropic у результатах пошуку Google та Bing. Це аж ніяк не прихований витік. Все почалося з того, що один із користувачів Reddit зауважив: специфічні URL-адреси, призначені для обміну «знімками» чатів, опинилися у відкритому доступі.

Йшлося не просто про якісь листування. Серед них були користувачі, які запитували поради щодо політичної приналежності. Юристи з Канзасу ставили юридичні питання у тому, чи мають вони повідомляти про свої етичні порушення. І, так, були сценарії еротичної рольової гри.

Якщо ви цінуєте конфіденційність в епоху генеративного ІІ, це важливий урок про те, як механізми веб-технологій беруть гору над добрими намірами.

Міф про Robots.txt

Ось технічна реальність, яку найчастіше не беруть до уваги як користувачі, так і часто самі компанії, які розробляють ці інструменти.

Anthropic використовує файл robots.txt, щоб повідомити пошукові роботи не відвідувати спільні посилання на чати. Цей файл існує як мінімум з вересня 2024 року (robots.txt – це галузевий стандарт для повідомлення: «Не скануйте цю частину сайту»).

Найчастіше це спрацьовує.

Але це не стіна. Це лише ввічливе прохання.

Пошукові системи, такі як Google і Bing, запрограмовані ігнорувати robots.txt, якщо вони знаходять посилання на сторінку десь ще в інтернеті. Якщо хтось розмістить посилання на цей «публічний» знімок Claude на форумі, в електронному листі чи соціальній мережі, пошуковий робот все одно проіндексує його.

Щоб заборонити індексацію, розробникам потрібно використовувати спеціальний HTML-тег.

Чому був відсутній «Noindex»

Згідно з повідомленням WIRED, вибігли чати, в яких був відсутній мета-тег “noindex”.

І Google, і Bing вимагають цієї явної вказівки. Якщо на сторінці немає тега noindex (або заголовка HTTP x-robots-tag ), пошукові системи виходять з того, що власник сайту хоче, щоб ця сторінка була проіндексована та відображалась у результатах пошуку.

«Ні Google, ні інші пошукові системи не контролюють те, що публікується у відкритому доступі в інтернеті… Ми надаємо власникам сайтів чіткі інструменти управління… і завжди поважаємо ці директиви».

Для пошукової системи така позиція цілком обґрунтована. Однак вона виглядає менш захищеною з боку Anthropic, особливо з огляду на те, що вони вже стикалися з подібними проблемами минулої осені.

Представник Google Нед Адріанс повідомив WIRED, що рішення про індексацію лежить на власнику сайту. Посилання на чати є публічними за задумом. Якщо URL-адреса доступна, вона може бути проіндексована.

Microsoft не прокоментувала ситуацію. Anthropic не відповіла.

Розрив між приватністю та індексацією

Ключова проблема тут полягає не у шкідливих намірах. Це зіткнення функцій.

Claude дозволяє користувачам генерувати публічні посилання обміну розмовою. Це зручно для спільної роботи. Але генерація публічного посилання автоматично запускає стандартну поведінку веб-індексації, якщо це явно не заблоковано на глибшому рівні.

Більшість користувачів вважають, що “загальний доступ” означає “приватне посилання”. Це негаразд. У світі пошукової оптимізації (SEO) “публічний URL” означає “потенційний результат пошуку”.

Це сталося і з Bing, який все ще показував близько 612 результатів для запиту site:claude.ai/share на момент публікації матеріалу. Результати Google для специфічного запиту share вдалося очистити, швидше за все, після того, як редактори WIRED перевірили їх, ймовірно, видаливши або оновивши посилання.

Але дані вже у мережі. Існують кешовані копії. Урок занадто суворий для всіх, хто використовує чат-боти ІІ для обговорення чутливих тем:

  1. Нічому не довіряйте як до абсолютної приватності.
  2. Публічні URL-адреси індексуються за умовчанням, якщо не реалізовані правильні технічні захисту.
  3. robots.txt недостатньо. Вам потрібен тег noindex.

ІІ-лабораторії заявляють, що шанують правила для роботів. І вони справді так роблять. Але вони покладаються на розробників, щоб вони використовували правильні правила. Якщо реалізація flawed, історія вашої еротичної рольової гри виявляється на сторінці результатів пошукової системи.

І ви не зможете «розгуглити» це.

Який ширший висновок? Оскільки ІІ-агенти стають дедалі більш інтегрованими у повсякденне життя — від автоматизації робочих процесів на смартфонах до використання державних токенів — поверхня для витоку приватності розширюється. Ми будуємо системи, які відповідають нам у діалозі, тоді як відкритий веб індексує кожну розмову.

Хто контролює індекс? Хто має пам’ять?

Скоріш за все, не ви.

попередня статтяФранція зіткнулася з історичною грозою, народженою вогнем: unprecedented пожежі