Занятие 2.3 · Раздаточный материал

Безопасность данных в AI

Что можно и нельзя загружать в ChatGPT, Claude и Gemini. Реальные утечки, извлечение обучающих данных, лестница риска и чек-лист обезличивания - с проверяемыми источниками.

Марина Бродская · AIHealthInnovations Курс «AI для жизни и медицины» · Блок 2 Факты и ссылки проверены: июль 2026
За 60 секунд: можно и нельзя
База с первых занятий. Все остальное здесь - то, что за пределами этого списка.

Можно

  • Обезличенные вопросы без привязки к конкретному человеку
  • Общие и учебные тексты, публичная информация
  • Черновики, письма, переводы без персональных данных
  • Обобщенные клинические сценарии без идентификаторов
  • Синтетические (выдуманные) примеры вместо реальных

Нельзя

  • Имена, ת"ז, телефоны, адреса пациентов и клиентов
  • Снимки, выписки, анализы с идентификаторами
  • Коммерческую тайну и внутренние документы компании
  • Чужие персональные данные (коллег, третьих лиц)
  • Пароли, ключи доступа, реквизиты
Как поменялись дефолты приватности
Раньше можно было полагаться на «нас не обучают». Для обычных (не корпоративных) аккаунтов это перестало быть верным.
ИнструментОбучение на ваших чатахХранениеКак отключить
ChatGPTOpt-out: по умолчанию ВКЛ (Free / Plus / Pro)Стандартно до 30 дней; удаленные и Temporary снова стираются за 30 днейData Controls → выкл. Improve the model; Temporary Chat
ClaudeВыбор при первом входе, тумблер предвыбран ВКЛ (Free / Pro / Max)30 дней → 5 лет при согласии на обучениеSettings → Privacy → выкл. Help improve Claude
GeminiЧаты читают живые ревьюеры GoogleПроверенные чаты до 3 лет, даже после удаленияGemini Apps Activity → выкл.; Temporary chat
Данные в чате - это четыре разных риска
«Опасно» - слишком общо. Полезнее различать, что именно может пойти не так. У каждого риска свой способ защиты.
Риск 1

Обучение на ваших данных

Фрагменты ваших чатов попадают в обучающий корпус будущих моделей. Отменить постфактум нельзя.

Риск 2

Хранение и удержание

Данные лежат на серверах и могут быть удержаны дольше обычного по судебному приказу или legal hold.

Риск 3

Просмотр людьми (human review)

Часть чатов выборочно читают живые ревьюеры для оценки качества и безопасности. Их копии живут дольше.

Риск 4

Юридическое раскрытие

Данные могут быть истребованы в суде или по ордеру - вне вашего контроля и контроля пациента.

Пять историй, которые стоит знать
Не страшилки, а задокументированные случаи. Каждый меняет представление о том, «куда уходят» ваши данные.
Дословная память

Repeat the word forever - и ChatGPT выдал чужие данные

$200 → 10 000+

Исследователи заставили ChatGPT бесконечно повторять слово - и модель начала выдавать дословные куски обучающего набора: настоящие e-mail-подписи, телефоны, адреса, фрагменты книг, код, bitcoin-адреса.

Около 5% ответа оказалось точной копией (по 50 токенов подряд) из обучающего корпуса. За 200 долларов запросов - более 10 000 фрагментов.

Google DeepMind, Cornell и др., ноябрь 2023. Дыру закрыли, но заучивание данных моделью осталось. arXiv:2311.17035

Хранение по предписанию суда

Удаление чата не гарантирует стирание данных

20 000 000

По иску New York Times истцы требовали хранить и передать логи чатов, включая удаленные. 5 января 2026 судья Stein подтвердил приказ; OpenAI заявила, что выполнила его - 20 млн обезличенных логов переданы юристам истца под защитным ордером («только для глаз адвокатов»).

Важно про удержание: его сузили. Новые удаленные и Temporary чаты снова стираются за 30 дней; под legal hold - исторический массив за апрель-сентябрь 2025. Логика суда: пользователи «добровольно отправили» сообщения.

In re: OpenAI Copyright Litigation (MDL, SDNY). Enterprise/Edu и ZDR-API под приказ не попали. Проверено: июль 2026. Позиция OpenAI

Штраф, который отменили

€15 млн штрафа, отмененные судом

€15 млн → отмена

В 2023 Италия первой на Западе на месяц забанила ChatGPT. 2 ноября 2024 регулятор Garante оштрафовал OpenAI на €15 млн - за обучение на персональных данных без правового основания и молчание об утечке дольше 72 часов.

18 марта 2026 суд Рима отменил штраф целиком, но не по существу, а из-за юрисдикции (лид-регулятором стал ирландский DPC). Это решение первой инстанции - Garante может обжаловать в Кассационном суде. Нарушил ли ChatGPT закон, так и не решено.

Garante (provvedimento n. 755) · Tribunale Ordinario di Roma, 18.03.2026 (R.G. 4785/2025). Проверено: июль 2026. Разбор решения

Утечка через людей

Samsung: 3 утечки за 20 дней

3 / 20 дней

Инженеры вставили в ChatGPT исходный код полупроводниковой базы (искали баг), код для поиска дефектов чипов и расшифровку внутреннего совещания для протокола.

Итог: компания запретила генеративный AI, пригрозила увольнением и занялась собственной моделью. Ни один сотрудник не был злоумышленником - все хотели работать быстрее.

Bloomberg, апрель 2023. Обзор в Forbes

Утечка через сам сервис

Баг ChatGPT: чужие данные показали посторонним

В марте 2023 из-за ошибки в библиотеке кеша на протяжении 9 часов около 1,2% Plus-подписчиков рисковали тем, что посторонний увидит их имя, e-mail, платежный адрес, тип карты и последние 4 цифры номера. Плюс - заголовки чужих чатов появлялись в истории других людей.

Полные номера карт не раскрывались, дыру закрыли в тот же день. Но вывод остается: даже добросовестный сервис может показать ваши данные другому пользователю.

Официальный разбор OpenAI. openai.com/march-20-chatgpt-outage

А что с медициной: можно ли понять, на каких историях училась модель?
Частично да - и в этом суть риска.
Ниже - три механизма, о которых спорят исследователи. Важно не переоценивать (простое извлечение имен из клинических моделей затруднено), но и не недооценивать (генеративные модели уязвимее).
Механизм 1

Membership inference

Можно оценивать, был ли конкретный случай среди обучающих данных. Насколько это реально - зависит от класса модели, ее архитектуры, доступа и данных.

Механизм 2

Извлечение данных

Генеративные модели способны выдавать дословные фрагменты с персональными данными. На ChatGPT это доказано (см. историю выше).

Осторожно с выводами

Не все так просто

Из клинического BERT наивно вытащить имя пациента - трудно (Lehman, 2021): модель слабо связывает данные с их владельцем. Риск реален, но не тривиален.

Лестница риска: что и куда можно отправлять
Не «AI - это опасно», а «какие данные и в какой контур». Выше ступень - больше нужно защиты.
1 · НизкийОбезличенные и общие вопросы, публичные данные→ любой чат, даже с обучением
2 · СреднийРабочие тексты без ПД, черновики, письма→ opt-out обучения + Temporary Chat
3 · ВысокийКосвенные идентификаторы, редкие случаи, внутренние документы→ корпоративный тариф; обезличивание обязательно
4 · КритическийИдентифицируемые данные пациента, ת"ז, коммерческая тайна→ защищенный контур, локальная модель или никуда
Важно. Синтетические (выдуманные) данные снижают риск, но не отменяют всех обязательств по закону. В Израиле медицинские записи регулируются Законом о правах пациента (1996) и Законом о защите приватности (Поправка 13, действует с августа 2025).
Матрица контуров: где и по каким правилам обрабатываются данные
«Контур» - это где физически обрабатываются данные и по каким правилам. Выбор контура важнее выбора модели.
КонтурЧто этоОбучение / удержаниеРеальные ПД / PHI
Consumer chatОбычный ChatGPT / Claude / Gemini (Free / Plus / Pro / Max)Может обучаться; удержание по дефолтуНельзя
Team / EnterpriseКорпоративные тарифы, коммерческие условияНе обучается по умолчанию; настраиваемое удержаниеС осторожностью
API + ZDRAPI с Zero Data Retention / коротким удержаниемНе обучается; данные не хранятся (ZDR)Да, при договоре
Локальная модельOllama, LM Studio на вашем компьютереДанные не покидают устройствоДа
On-prem клиникаМодель в контуре клиники или больницыПод контролем организации и ее политикДа, по регламенту
«С осторожностью» и «по договору» = обезличивание + допустимый остаточный риск + разрешенный контур обработки. Само наличие BAA или корпоративного тарифа не делает загрузку PHI автоматически законной.
Скрытая ловушка: «обезличил» не значит «анонимно»
Убрать имя мало. Сочетание редких признаков само указывает на человека.
Обезличенный (?) фрагмент
Пациент: [имя удалено]
Диагноз: редкая форма саркомы
Город: поселок на 4 000 жителей
Даты: госпитализация 14–21 марта
Возраст: 83 года
Узнаваемый человек. Редкий диагноз + маленький поселок + точные даты + возраст = один конкретный пациент. Коллега по региону узнает его без всякого имени.
Правило. Обобщайте квази-идентификаторы: возраст → диапазон (80+), даты → относительные («на 2-й неделе»), редкий диагноз → более общая категория, географию → округ или регион. Чем реже случай, тем сильнее обобщайте.
Чек-лист обезличивания перед отправкой
Пройдите по строкам, прежде чем вставлять что-либо в чат.
Что убрать или заменитьНа что заменить
Имя, фамилия, инициалы[Пациент] или условная метка
Удостоверение личности (ת"ז), номер дела, страховкаУбрать полностью
Телефон, e-mail, адресУбрать полностью
Точные даты (рождения, визита, госпитализации)Относительные: «неделю назад», «на 3-й день»
Возраст у пожилых и детейДиапазон: 80+, «около 40»
Редкий диагноз или редкое сочетание признаковБолее общая категория
Название клиники, отделения, имя врача«Городская клиника», «онкоотделение»
Геолокация меньше городаРегион или округ
Инструменты, которые вычищают идентификаторы
Есть облачные и автономные. Для медицины важнее автономные: они работают локально и не отправляют данные наружу.
ИнструментТипЧто делает и кому
NLM-Scrubberавтономный, локальноБесплатный инструмент NIH. Убирает идентификаторы HIPAA из клинического текста прямо на вашем компьютере - данные не покидают машину. Текущие сборки: Windows, Linux.
Philter / CliniDeIDавтономные, локальноOpen-source, разворачиваются on-premise (командная строка или контейнер). Для потоковой чистки заметок и исследовательских выборок.
ARXавтономный, локальноДля табличных данных: k-анонимность, l-разнообразие. Оценивает риск реидентификации в датасете.
Microsoft PresidioбиблиотекаOpen-source. Текстовый PII-движок; отдельный модуль presidio-image-redactor (DicomImageRedactorEngine) чистит вожженный в пиксели текст в DICOM - но не метаданные DICOM.
AWS Comprehend MedicalоблачныйManaged-сервис Amazon, в основном для англоязычного клинического текста. Данные уходят в облако; BAA/договор не равен автоматической законности обработки.
Главное про инструменты: ни один не ловит все. Автотул - это первый проход, финальную проверку всегда делайте глазами. Обезличивание снижает риск, но не отменяет обязательств по закону.
Личный чек-лист: пример на реальном запросе
Как выглядит обезличивание на практике - до, после и 6 вопросов для самопроверки.
Было (так нельзя)

Пациентка Рахель Леви, ת"ז 023-456789, 82 года, поселок Йерухам, поступила 14 марта с редкой саркомой мягких тканей. Тел. 050-1234567. Составь план наблюдения.

Стало (риск ниже, не гарантия анонимности)

Пациент(ка) старшего возраста, поступил(а) недавно с онкологическим диагнозом (саркома). Опиши общий подход к плану наблюдения. (Вывод требует проверки врачом.)

6 вопросов перед отправкой - распечатайте и держите под рукой
Убрал имя, ת"ז, телефон, адрес?
Расширил редкий диагноз до общей категории?
Заменил точные даты на относительные?
Малый город заменил на регион или округ?
Обобщил возраст до диапазона (80+)?
Пометил, что мед. вывод требует проверки врачом?
Настройки приватности: сделайте прямо сейчас
Вот как выглядит нужный переключатель в каждом инструменте. Везде его надо поставить в положение ВЫКЛ.

ChatGPT

Settings → Data Controls
Improve the model for everyone
держите ВЫКЛ

Выключает обучение на новых чатах. История остается на месте. Для разовых задач - Temporary Chat.

Claude

Settings → Privacy
Help improve Claude
держите ВЫКЛ

По умолчанию ВКЛ. Выключение возвращает хранение 30 дней вместо 5 лет.

Gemini

Gemini Apps Activity
Keep Activity (Gemini)
держите ВЫКЛ

Выключение убирает и вашу историю чатов. Доступ к Gmail и Messages отключается отдельно.

Что эти настройки все равно не закрывают
ИнструментВажная оговорка
ChatGPTOpt-out не удаляет прошлые чаты и не стирает уже отправленное. Реклама - только на тарифах Free/Go (тест с 09.02.2026, США); Plus/Pro/Business/Enterprise/Edu без рекламы. Рекламодатели не получают доступ к чатам, истории и памяти; реклама не показывается рядом с темами здоровья, психики и политики.
ClaudeТумблер по умолчанию ВКЛ - темный паттерн (крупная кнопка Accept, мелкий предвыбранный тумблер; отмечено The Verge и TechCrunch). Согласие продлевает хранение с 30 дней до 5 лет. Уже использованное для обучения вернуть нельзя.
GeminiОтключение Activity стирает и вашу историю чатов. Чаты, которые прочитали живые ревьюеры, хранятся 3 года и не удаляются. Доступ к Gmail, Messages, WhatsApp отключается отдельно.
Источники и что почитать
Первичные материалы для проверки каждого утверждения.
Все утверждения и ссылки проверены в июле 2026. Настройки, тарифы и статусы судебных дел меняются - перед повтором лекции сверьте актуальность.