Вы думаете, что ваши разговоры с искусственным интеллектом остаются приватными.
Но это не всегда так.
Достаточно обратиться к тем, кто в выходные увидел свои интимные или политически острые диалоги с Claude от Anthropic в результатах поиска Google и Bing. Это отнюдь не скрытая утечка. Все началось с того, что один из пользователей Reddit заметил: специфические URL-адреса, предназначенные для обмена «снимками» чатов, оказались в открытом доступе.
Речь шла не просто о каких-то переписках. Среди них были пользователи, запрашивавшие советы по политической принадлежности. Юристы из Канзаса задавали юридические вопросы о том, обязаны ли они сообщать о собственных этических нарушениях. И, да, присутствовали сценарии эротической ролевой игры.
Если вы цените конфиденциальность в эпоху генеративного ИИ, это важный урок о том, как механизмы веб-технологий берут верх над благими намерениями.
Миф о Robots.txt
Вот техническая реальность, которую чаще всего упускают из виду как пользователи, так и часто сами компании, разрабатывающие эти инструменты.
Anthropic использует файл robots.txt, чтобы сообщить поисковым роботам не посещать общие ссылки на чаты. Этот файл существует как минимум с сентября 2024 года (robots.txt — это отраслевой стандарт для сообщения: «Не сканируйте эту часть сайта»).
Чаще всего это срабатывает.
Но это не стена. Это лишь вежливая просьба.
Поисковые системы, такие как Google и Bing, запрограммированы игнорировать robots.txt, если они находят ссылку на страницу где-то еще в интернете. Если кто-то разместит ссылку на этот «публичный» снимок Claude на форуме, в электронном письме или социальной сети, поисковый робот все равно проиндексирует её.
Чтобы действительно запретить индексацию, разработчикам нужно использовать специальный HTML-тег.
Почему отсутствовал «Noindex»
Согласно сообщению WIRED, утекли чаты, в которых отсутствовал мета-тег noindex.
И Google, и Bing требуют этого явного указания. Если на странице нет тега noindex (или заголовка HTTP x-robots-tag ), поисковые системы исходят из того, что владелец сайта хочет, чтобы эта страница была проиндексирована и отображалась в результатах поиска.
«Ни Google, ни какие-либо другие поисковые системы не контролируют то, что публикуется в открытом доступе в интернете… Мы предоставляем владельцам сайтов четкие инструменты управления… и всегда уважаем эти директивы».
Для поисковой системы такая позиция вполне обоснована. Однако она выглядит менее защищенной со стороны Anthropic, особенно учитывая, что они уже сталкивались с подобными проблемами прошлой осенью.
Представитель Google Нед Адрианс сообщил WIRED, что решение об индексации лежит на владельце сайта. Ссылки на чаты являются публичными по задумке. Если URL-адрес доступен, он может быть проиндексирован.
Microsoft не прокомментировала ситуацию. Anthropic не ответила.
Разрыв между приватностью и индексацией
Ключевая проблема здесь заключается не во вредоносных намерениях. Это столкновение функций.
Claude позволяет пользователям генерировать публичные ссылки для обмена разговором. Это удобно для совместной работы. Но генерация публичной ссылки автоматически запускает стандартное поведение веб-индексации, если это явно не заблокировано на более глубоком уровне.
Большинство пользователей считают, что «общий доступ» означает «приватная ссылка». Это не так. В мире поисковой оптимизации (SEO) «публичный URL» означает «потенциальный результат поиска».
Это произошло и с Bing, который все еще показывал около 612 результатов для запроса site:claude.ai/share на момент публикации материала. Результаты Google для специфичного запроса «share» удалось очистить, скорее всего, после того, как редакторы WIRED проверили их, вероятно, удалив или обновив ссылки.
Но данные уже в сети. Существуют кэшированные копии. Урок слишком суров для всех, кто использует чат-боты ИИ для обсуждения чувствительных тем:
- Ничему не доверяйте как к абсолютной приватности.
- Публичные URL индексируются по умолчанию, если не реализованы правильные технические защиты.
robots.txtнедостаточно. Вам нужен тегnoindex.
ИИ-лаборатории заявляют, что уважают правила для роботов. И они действительно так делают. Но они полагаются на разработчиков, чтобы те использовали правильные правила. Если реализация flawed, история вашей эротической ролевой игры оказывается на странице результатов поисковой системы.
И вы не сможете «раз-гуглить» это.
Каков более широкий вывод? Поскольку ИИ-агенты становятся все более интегрированными в повседневную жизнь — от автоматизации рабочих процессов на смартфонах до использования государственных токенов — поверхность для утечки приватности расширяется. Мы строим системы, которые отвечают нам в диалоге, в то время как открытый веб индексирует каждый разговор.
Кто контролирует индекс? Кто владеет памятью?
Скорее всего, не вы.



















