Что можно и что нельзя грузить в нейросеть — три зоны данных

Искусственный интеллект

Одного правила про данные не существует. Работает классификация из трёх зон — что никогда не уходит в облако, что отправляется только обезличенно и что можно грузить свободно. Отдельно разобрано обезличивание таблицы макросом, при котором сам файл никуда не отправляется.

1 мин чтения 8 сентября 2026 Алексей Борисов

Вопрос про данные задают в каждой аудитории, и почти всегда в одной и той же форме. Люди ищут одно правило, которое можно записать и повесить над рабочим столом. Такого правила нет. Работает классификация из трёх зон, и применяется она к конкретному файлу, который прямо сейчас открыт на экране.

Масштаб проблемы измерим. По опросу середины 2026 года 50,5 % российских компаний подозревают утечки через ИИ-инструменты, у 8,1 % есть подтверждённые случаи (ComNews, июль 2026). Разрыв между этими двумя цифрами объясним. Загрузка рабочего файла в чат не порождает инцидента, который служба безопасности могла бы увидеть в журналах, поэтому большинство компаний остаётся в состоянии подозрения без возможности его проверить.

Три зоны данных: никогда в облако, только обезличенно, свободно
Три зоны данных. Слайд из курса «ИИ в бизнес-процессах»
Зона Что сюда относится Куда можно отправлять
Никогда в облако Персональные данные клиентов, счета и карты, банковская тайна, кредитные досье, внутренние тарифы, зарплатные таблицы, конструкторская документация с реальными параметрами изделий ГигаЧат Enterprise или локальная модель внутри контура
Только обезличенно Договоры без реквизитов, обращения без фамилий, статистика без привязки к конкретным клиентам Любая модель после удаления идентификаторов
Свободно Нормативные акты, публичные документы, черновики без данных, учебные задачи Любая модель

Зона первая. Никогда в облако

Сюда попадает всё, что защищено законом или коммерческой ценностью само по себе. Персональные данные клиентов, счета и карты, банковская тайна, кредитные досье, внутренние тарифы. В производственных компаниях в ту же зону уходят зарплатные таблицы и конструкторская документация с реальными параметрами изделий.

Полезная бытовая формулировка, которую я обычно даю в аудитории. Загрузить рабочую таблицу с реальными цифрами в публичную модель — это примерно тот же уровень безопасности, что выложить её в открытый доступ в интернете. Формулировка кажется резкой ровно до того момента, пока не начнёшь разбирать, чем она опровергается.

Опровергается она только пользовательским соглашением. В соглашениях ЧатГПТ и подобных сервисов написано, что платные тарифы не используются для обучения моделей. Формально это так. Проверить это со стороны пользователя невозможно — у вас нет доступа ни к обучающим датасетам, ни к журналам обработки, ни к списку подрядчиков поставщика. Поэтому в решениях стоит опираться на классификацию собственных данных. Обещание поставщика проверке не поддаётся, а последствия наступают у вас.

ИИ-риски для информационной безопасности
Публичные модели — для обучения и черновиков, чувствительные данные — только в согласованный контур. Слайд из курса

Прецеденты уже есть. Публично расшаренные чаты ЧатГПТ однажды попали в поисковую выдачу целиком, вместе с содержимым. Разработчики «Покемон Го» продали данные, собранные игроками, включая съёмку закрытых помещений, компании по навигации. То, что несколько лет считалось теорией заговора, оказалось обычной монетизацией накопленного массива.

Чувствительное отправляется в ГигаЧат Enterprise или в локальную модель внутри контура. В банках, где я вёл курсы, девять из десяти локальных развёртываний — это Квен, реже ДипСик, ЧатГПТ во внутреннем контуре не встречается. Отдельная деталь для банковской специфики. ГигаЧат — продукт Сбербанка, и у конкурентов на него могут быть корпоративные ограничения, никак не связанные с 152-ФЗ. Уточнять в службе безопасности стоит оба ограничения сразу.

Российские сервисы, к слову, сами подталкивают к классификации. ГигаЧат при загрузке файла отдельно спрашивает про персональные данные ещё до того, как начнёт обработку.

Зона вторая. Только обезличенно

Договоры без реквизитов, обращения без фамилий, статистика без привязки к конкретным клиентам. Это самая большая по объёму и самая продуктивная зона. Именно здесь лежит основная часть рутины, которую действительно имеет смысл автоматизировать — разбор тысячи обращений по темам, сравнение условий в пачке договоров, кластеризация жалоб, черновик ответа по типовой ситуации.

Здесь есть ловушка, которую стоит разобрать заранее. Замена фамилии на слово «Клиент» полезна, но не всегда достаточна. Если в тексте остались редкая должность, дата операции, сумма, регион и номер договора, документ по-прежнему сопоставим с конкретным человеком или организацией — просто в два действия вместо одного. Проверять поэтому стоит другое. Восстанавливается ли конкретный человек по сочетанию оставшихся в документе признаков.

Таблица соответствия исходных значений и заглушек, если она нужна процессу, хранится отдельно и в модель не отправляется никогда. Для сценариев с высокой ценой ошибки порядок внедрения разобран подробно в статье «Как безопасно внедрить генеративный ИИ в банке» — там же про паспорт сценария и про то, кто в организации отвечает за результат.

Зона третья. Свободно

Нормативные акты и публичные документы, черновики без данных, учебные задачи. Всё, что и так лежит в открытом доступе, ничего не теряет от попадания в облачную модель.

Одна оговорка, которую в этой зоне пропускают чаще всего. Безопасность отправки и достоверность ответа — разные вещи. Нормативный текст можно грузить куда угодно, но именно на нормативке модель ошибается с наибольшей уверенностью. Срез обучающих данных не совпадает с действующей редакцией, при этом закон выглядит для модели как любой другой текст, поэтому ответ получается гладким и устаревшим одновременно. Механика этого разобрана в статье «Почему нейросеть выдумывает факты».

Обезличивание макросом

Из трёх зон вытекает практическая задача. Прежде чем отправлять массив обращений или переписки во вторую зону, из него нужно убрать персональные данные. Руками на тысячах строк это бессмысленно, поэтому обезличивание оформляется отдельным автоматическим шагом.

Самый доступный вариант для офисного сотрудника — макрос. Постановка задачи модели звучит буквально так. «Напиши код, который в файле Excel удаляет персональные данные или заменяет их на обезличенные шаблонные значения». Модель выдаёт готовый макрос и инструкцию по установке, дальше сотрудник проходит по шагам. Вкладка «Разработчик» включается через «Файл — Параметры — Настроить ленту», редактор открывается кнопкой Visual Basic или сочетанием Alt+F11, код вставляется через «Insert — Модуль», запускается из «Вид — Макросы».

Существенная деталь здесь одна, и ради неё весь приём и нужен. Сам исходный файл никуда не отправляется. Модель пишет код, код выполняется на компьютере сотрудника, данные остаются на месте. Это единственный полностью безопасный способ работать с чувствительной таблицей через публичную модель.

VBA в корпоративном периметре обычно проходит проще, чем Python. Скрипт на Python в большинстве организаций потребует согласования со службой безопасности, и это решаемая задача, но она занимает недели. Макрос в Excel — привычный офисный инструмент, вопросов к нему заметно меньше.

Что обычно ломается в обезличивании

Проверять результат надо по существу. Факт выполнения макроса здесь ничего не доказывает. Типовая ошибка из разборов на занятиях выглядела так. Макрос корректно убрал все телефоны и отработал без единой ошибки, а даты рождения остались на месте — потому что в постановке задачи их не назвали. Формально код сделал ровно то, о чём его попросили.

Обезличивание — это перечень полей. Общее пожелание убрать персональные данные модель трактует по-своему, поэтому в постановке задачи всё перечисляется поимённо. Фамилии, телефоны, адреса, даты рождения, паспортные данные, ИНН, номера договоров, адреса электронной почты. Список составляется по вашему файлу, универсальной рекомендации здесь не существует, и собирать его лучше глазами по реальному фрагменту таблицы.

После прогона макроса откройте файл и посмотрите глазами хотя бы двадцать случайных строк. Проверка занимает пять минут и снимает основную часть риска.

Советоваться с моделью, не загружая в неё данные

Приём с макросом стоит осознавать шире. У работы с моделью есть два разных режима. В первом она обрабатывает содержимое вашего файла. Во втором пишет инструмент, которым файл обработаете вы сами, и тогда содержимого она вообще не видит — вы описываете структуру таблицы словами и получаете код.

Три стопора применения ИИ: высокие ставки, необратимые действия, неоднозначные данные
Три стопора применения ИИ. Слайд из курса

Так же устроен третий из трёх стопоров применения ИИ. Чувствительные персональные данные, противоречивые источники и слабый контекст — ситуация, где модель не остановится и не переспросит. Она додумает и ошибётся, причём уверенным тоном. Классификация данных нужна ровно для того, чтобы такая ситуация не наступила по недосмотру.

Разобрать три зоны по своим рабочим файлам достаточно один раз. Дальше это перестаёт быть отдельным решением и превращается в привычку — вы смотрите на файл и уже знаете, в какую зону он попадает и что с ним нужно сделать перед отправкой.