RULE 110Современные решения цифровых задачЗаметки
9 июля 20268 мин чтения

Закрытый контур: где он протекает

Вместе с задачей подрядчику уезжают выгрузки, переписка и схема расчёта себестоимости. Новое в том, что на этом пути появился участник, которого не было в договоре. Разбираем, где на самом деле течёт — и это не там, где принято искать.

Когда компания отдаёт разработку наружу, она отдаёт не одну задачу. Вместе с ней уезжают выгрузки из базы, переписка с клиентами, схема расчёта себестоимости, иногда персональные данные пользователей. Так было всегда. Новое в том, что на этом пути теперь стоит ещё один участник, которого не было в договоре, — модель.

Вопрос «а это безопасно?» почти всегда получает один ответ: «не переживайте, на ваших данных никто не обучается». Ответ, как правило, правдивый. И почти бесполезный.

Три тумблера, которые принято считать одним

«Не обучаются на ваших данных», «не хранят ваши данные» и «никто из людей их не увидит» — три разных обязательства. Первое не даёт ни второго, ни третьего.

Проще всего это видно в документации самих поставщиков, где обе вещи спокойно уживаются на одной странице. У OpenAI в правилах программного доступа сказано, что с 1 марта 2023 года данные не идут на обучение, если клиент сам их не отдал. А несколькими абзацами ниже, тем же ровным тоном, — что журналы для контроля злоупотреблений создаются для всего использования и хранятся до 30 дней, дольше, если требует закон.

Обучения нет, хранение есть. Обе фразы верны одновременно, и вторую в разговоре обычно не произносят.

Режим, при котором содержимое запросов не сохраняется вовсе, тоже существует. Важная деталь: он не включается сам и по умолчанию не даётся. В документации прямо сказано, что такие настройки требуют предварительного одобрения и принятия дополнительных условий. О нём нужно попросить и его нужно получить.

Отсюда практический вывод. Вопрос «вы обучаетесь на наших данных?» слишком узкий, на него легко ответить «нет» совершенно честно. Спрашивать надо три вещи по отдельности: идут ли данные на обучение, сколько они хранятся и кто из людей может их прочитать.

Где на самом деле течёт

Самое интересное, что главный канал утечки — вообще не поставщик модели. С ним-то как раз можно договориться, у него есть документ, сроки, юридическое лицо и репутация, которой он дорожит. Течёт там, где никакого договора нет.

Производители систем защиты от утечек за 2025–2026 годы дают такую картину. Около 27% того, что сотрудники вставляют в ИИ-инструменты, относится к чувствительному. Годом раньше было около 11%. Вставляет туда что-то примерно каждый пятый, и больше половины таких вставок содержат корпоративную информацию.

Но главная цифра другая. Больше 60% этих обращений идут через личные аккаунты.

Вот тут всё и рушится. Тщательно прописанный корпоративный договор, с нужным сроком хранения и отключённым обучением, действует ровно там, где им пользуются через корпоративный доступ, и совершенно не действует на личный аккаунт сотрудника, у которого условия другие, а в потребительских тарифах обучение на переписке нередко включено по умолчанию. Компания может всё сделать правильно на уровне закупки и всё равно отдать данные, потому что работа шла не там, где договор.

Оговорка, которую честнее сделать сразу: считали это люди, которые продают решение той же проблемы. Порядок величин у разных отчётов сходится, но верить в точность до десятых не стоит. Важна тут не точность, а куда всё сдвинулось: канал утечки съехал с инфраструктуры на людей и их привычки.

Российская рамка добавляет ещё одно измерение

Если в проекте есть персональные данные граждан России, к вопросу «где хранится» добавляется «на какой территории». Закон требует, чтобы базы с такими данными находились в России, а трансграничная передача — отдельная процедура, а не то, что случайно получается, если выбрать инструмент поудобнее.

И вопрос теперь звучит по-другому. Не «безопасен ли инструмент», а «что вообще имеет право покинуть контур». Отвечать на него нужно до начала работы, а не после инцидента.

Что с этим делают

Без технических подробностей — четыре решения, и все они принимаются до первой строки кода.

Разделить данные заранее. Не всё, что нужно разработчику, одинаково чувствительно. Схема таблиц, логика расчёта, структура интеграции — одно. Реальные записи о людях и коммерческие условия сделок — другое. Сделали один раз на входе — дальше держится само собой.

Показывать модели муляж вместо оригинала. Для отладки настоящие данные почти никогда не нужны, нужны данные правильной формы. Реальная выгрузка заменяется сгенерированной — те же поля, те же связи, тот же объём, ни одного настоящего человека внутри. (Работа скучная, и пропускают её именно поэтому.)

То, что нельзя отдавать, обрабатывать у себя. Часть задач решается моделью, работающей внутри контура. Это медленнее и дороже, поэтому применяется адресно — к тому узкому классу данных, который выпускать действительно нельзя.

Договор вместо галочки в интерфейсе. Настройки в личном кабинете владелец сервиса меняет в одностороннем порядке, условия договора — нет. Если сроки хранения важны, им место в документе.

И одно организационное правило, которое перевешивает три технических: работа не ведётся через личные аккаунты. По приведённым цифрам это самый массовый канал утечки, и закрывается он дисциплиной, а не технологией.

Что спросить у подрядчика

Спросить стоит о четырёх вещах. Какие категории наших данных выходят за пределы контура, а какие не выходят никогда. Через какие учётные записи ведётся работа и что написано в их условиях про обучение и хранение. Что видит модель при отладке — настоящие записи или сгенерированные. И кому принадлежат код, данные и наработанный контекст после окончания работ.

Последний вопрос выглядит юридическим, а проверяет то же самое. Если исполнитель не может ответить, где лежат ваши данные, он и передать их вам целиком не сможет.