Что можно и нельзя загружать в ChatGPT, Claude и Gemini. Реальные утечки, извлечение обучающих данных, лестница риска и чек-лист обезличивания - с проверяемыми источниками.
| Инструмент | Обучение на ваших чатах | Хранение | Как отключить |
|---|---|---|---|
| ChatGPT | Opt-out: по умолчанию ВКЛ (Free / Plus / Pro) | Стандартно до 30 дней; удаленные и Temporary снова стираются за 30 дней | Data Controls → выкл. Improve the model; Temporary Chat |
| Claude | Выбор при первом входе, тумблер предвыбран ВКЛ (Free / Pro / Max) | 30 дней → 5 лет при согласии на обучение | Settings → Privacy → выкл. Help improve Claude |
| Gemini | Чаты читают живые ревьюеры Google | Проверенные чаты до 3 лет, даже после удаления | Gemini Apps Activity → выкл.; Temporary chat |
Фрагменты ваших чатов попадают в обучающий корпус будущих моделей. Отменить постфактум нельзя.
Данные лежат на серверах и могут быть удержаны дольше обычного по судебному приказу или legal hold.
Часть чатов выборочно читают живые ревьюеры для оценки качества и безопасности. Их копии живут дольше.
Данные могут быть истребованы в суде или по ордеру - вне вашего контроля и контроля пациента.
Исследователи заставили ChatGPT бесконечно повторять слово - и модель начала выдавать дословные куски обучающего набора: настоящие e-mail-подписи, телефоны, адреса, фрагменты книг, код, bitcoin-адреса.
Около 5% ответа оказалось точной копией (по 50 токенов подряд) из обучающего корпуса. За 200 долларов запросов - более 10 000 фрагментов.
Google DeepMind, Cornell и др., ноябрь 2023. Дыру закрыли, но заучивание данных моделью осталось. arXiv:2311.17035
По иску New York Times истцы требовали хранить и передать логи чатов, включая удаленные. 5 января 2026 судья Stein подтвердил приказ; OpenAI заявила, что выполнила его - 20 млн обезличенных логов переданы юристам истца под защитным ордером («только для глаз адвокатов»).
Важно про удержание: его сузили. Новые удаленные и Temporary чаты снова стираются за 30 дней; под legal hold - исторический массив за апрель-сентябрь 2025. Логика суда: пользователи «добровольно отправили» сообщения.
In re: OpenAI Copyright Litigation (MDL, SDNY). Enterprise/Edu и ZDR-API под приказ не попали. Проверено: июль 2026. Позиция OpenAI
В 2023 Италия первой на Западе на месяц забанила ChatGPT. 2 ноября 2024 регулятор Garante оштрафовал OpenAI на €15 млн - за обучение на персональных данных без правового основания и молчание об утечке дольше 72 часов.
18 марта 2026 суд Рима отменил штраф целиком, но не по существу, а из-за юрисдикции (лид-регулятором стал ирландский DPC). Это решение первой инстанции - Garante может обжаловать в Кассационном суде. Нарушил ли ChatGPT закон, так и не решено.
Garante (provvedimento n. 755) · Tribunale Ordinario di Roma, 18.03.2026 (R.G. 4785/2025). Проверено: июль 2026. Разбор решения
Инженеры вставили в ChatGPT исходный код полупроводниковой базы (искали баг), код для поиска дефектов чипов и расшифровку внутреннего совещания для протокола.
Итог: компания запретила генеративный AI, пригрозила увольнением и занялась собственной моделью. Ни один сотрудник не был злоумышленником - все хотели работать быстрее.
Bloomberg, апрель 2023. Обзор в Forbes
В марте 2023 из-за ошибки в библиотеке кеша на протяжении 9 часов около 1,2% Plus-подписчиков рисковали тем, что посторонний увидит их имя, e-mail, платежный адрес, тип карты и последние 4 цифры номера. Плюс - заголовки чужих чатов появлялись в истории других людей.
Полные номера карт не раскрывались, дыру закрыли в тот же день. Но вывод остается: даже добросовестный сервис может показать ваши данные другому пользователю.
Официальный разбор OpenAI. openai.com/march-20-chatgpt-outage
Можно оценивать, был ли конкретный случай среди обучающих данных. Насколько это реально - зависит от класса модели, ее архитектуры, доступа и данных.
Генеративные модели способны выдавать дословные фрагменты с персональными данными. На ChatGPT это доказано (см. историю выше).
Из клинического BERT наивно вытащить имя пациента - трудно (Lehman, 2021): модель слабо связывает данные с их владельцем. Риск реален, но не тривиален.
| Контур | Что это | Обучение / удержание | Реальные ПД / PHI |
|---|---|---|---|
| Consumer chat | Обычный ChatGPT / Claude / Gemini (Free / Plus / Pro / Max) | Может обучаться; удержание по дефолту | Нельзя |
| Team / Enterprise | Корпоративные тарифы, коммерческие условия | Не обучается по умолчанию; настраиваемое удержание | С осторожностью |
| API + ZDR | API с Zero Data Retention / коротким удержанием | Не обучается; данные не хранятся (ZDR) | Да, при договоре |
| Локальная модель | Ollama, LM Studio на вашем компьютере | Данные не покидают устройство | Да |
| On-prem клиника | Модель в контуре клиники или больницы | Под контролем организации и ее политик | Да, по регламенту |
| Что убрать или заменить | На что заменить |
|---|---|
| Имя, фамилия, инициалы | [Пациент] или условная метка |
| Удостоверение личности (ת"ז), номер дела, страховка | Убрать полностью |
| Телефон, e-mail, адрес | Убрать полностью |
| Точные даты (рождения, визита, госпитализации) | Относительные: «неделю назад», «на 3-й день» |
| Возраст у пожилых и детей | Диапазон: 80+, «около 40» |
| Редкий диагноз или редкое сочетание признаков | Более общая категория |
| Название клиники, отделения, имя врача | «Городская клиника», «онкоотделение» |
| Геолокация меньше города | Регион или округ |
| Инструмент | Тип | Что делает и кому |
|---|---|---|
| NLM-Scrubber | автономный, локально | Бесплатный инструмент NIH. Убирает идентификаторы HIPAA из клинического текста прямо на вашем компьютере - данные не покидают машину. Текущие сборки: Windows, Linux. |
| Philter / CliniDeID | автономные, локально | Open-source, разворачиваются on-premise (командная строка или контейнер). Для потоковой чистки заметок и исследовательских выборок. |
| ARX | автономный, локально | Для табличных данных: k-анонимность, l-разнообразие. Оценивает риск реидентификации в датасете. |
| Microsoft Presidio | библиотека | Open-source. Текстовый PII-движок; отдельный модуль presidio-image-redactor (DicomImageRedactorEngine) чистит вожженный в пиксели текст в DICOM - но не метаданные DICOM. |
| AWS Comprehend Medical | облачный | Managed-сервис Amazon, в основном для англоязычного клинического текста. Данные уходят в облако; BAA/договор не равен автоматической законности обработки. |
Пациентка Рахель Леви, ת"ז 023-456789, 82 года, поселок Йерухам, поступила 14 марта с редкой саркомой мягких тканей. Тел. 050-1234567. Составь план наблюдения.
Пациент(ка) старшего возраста, поступил(а) недавно с онкологическим диагнозом (саркома). Опиши общий подход к плану наблюдения. (Вывод требует проверки врачом.)
Выключает обучение на новых чатах. История остается на месте. Для разовых задач - Temporary Chat.
По умолчанию ВКЛ. Выключение возвращает хранение 30 дней вместо 5 лет.
Выключение убирает и вашу историю чатов. Доступ к Gmail и Messages отключается отдельно.
| Инструмент | Важная оговорка |
|---|---|
| ChatGPT | Opt-out не удаляет прошлые чаты и не стирает уже отправленное. Реклама - только на тарифах Free/Go (тест с 09.02.2026, США); Plus/Pro/Business/Enterprise/Edu без рекламы. Рекламодатели не получают доступ к чатам, истории и памяти; реклама не показывается рядом с темами здоровья, психики и политики. |
| Claude | Тумблер по умолчанию ВКЛ - темный паттерн (крупная кнопка Accept, мелкий предвыбранный тумблер; отмечено The Verge и TechCrunch). Согласие продлевает хранение с 30 дней до 5 лет. Уже использованное для обучения вернуть нельзя. |
| Gemini | Отключение Activity стирает и вашу историю чатов. Чаты, которые прочитали живые ревьюеры, хранятся 3 года и не удаляются. Доступ к Gmail, Messages, WhatsApp отключается отдельно. |