Безопасность данных

Соответствие 152-ФЗ

A4doc работает с требованиями Федерального закона № 152-ФЗ «О персональных данных». Прямые идентификаторы скрываются до того, как текст уйдёт в языковую модель, а исходные значения остаются на нашей стороне и подставляются обратно уже в готовый документ.

Как это работает

Кратко

Сервис стоит между документом и внешней языковой моделью: обезличивает текст до отправки и возвращает данные обратно после ответа

До модели

Сервис находит в тексте прямые идентификаторы и заменяет их метками. Происходит это на нашем сервере, до того как запрос сформирован.

У провайдера

Языковая модель получает текст с метками: без имён, телефонов, почты, реквизитов и номеров документов, которые удалось распознать.

После ответа

Метки в ответе заменяются обратно на исходные значения — с тем же падежом и написанием. Пользователь видит документ без изменений.

В журнале

Остаётся факт замены и количество найденных сущностей по типам. Сами значения в журнал не пишутся.

Такая схема отделяет исходные персональные данные от вычислительных мощностей внешнего провайдера: прямые идентификаторы граждан России ему не передаются.

Принципы

На чём построена защита

Пять правил, по которым сервис обращается с персональными данными в каждом запросе

Минимум данных наружу

Внешней модели передаётся только то, что нужно для задачи. Прямые идентификаторы заменяются метками, а не отправляются «на всякий случай».

Одна сущность — одна метка

Все упоминания одного человека получают один номер, даже если он назван в разных падежах или сокращённо. Модель понимает, кто участник, не зная его имени.

Обратная замена только у нас

Связь «метка → исходное значение» существует только на нашей стороне и не передаётся ни модели, ни службе распознавания.

Отказ вместо утечки

Если распознавание недоступно, запрос в модель не отправляется, а пользователь получает сообщение об ошибке. Отправить текст без маскирования сервис не может.

Проверяемость

Факт маскирования и количество найденных сущностей фиксируются в журнале. Значения ПДн туда не попадают, поэтому журнал не становится вторым хранилищем данных.

По шагам

Как работает скрытие данных

Замена происходит до того, как запрос попадёт куда-либо ещё — к провайдеру, в историю запросов или в отладочные записи

01

Запрос принят

Текст запроса и материалы проекта остаются на нашем сервере.

02

Поиск данных

Формальные шаблоны находят почту, телефоны, ИНН, СНИЛС, ОГРН, номера карт и документов. Имена людей и названия организаций находит служба распознавания, которая работает во внутренней сети и наружу не публикуется.

03

Замена на метки

Найденные значения заменяются метками вида ⟦PER1⟧, ⟦PHONE1⟧, ⟦EMAIL1⟧. Повторные упоминания того же человека получают номер вхождения: ⟦PER1.2⟧.

04

Запрос к модели

Провайдер получает подготовленный текст. В историю запросов сервиса тоже сохраняется уже обезличенный вариант.

05

Таблица соответствия

Пары «метка → значение» живут в памяти процесса, который обрабатывает запрос. В базу, кеш и логи они не попадают.

06

Обратная замена

В ответе модели на место каждой метки подставляется ровно та подстрока, которую заменили. Поэтому падеж и написание сохраняются: «Иванову Ивану» останется «Иванову Ивану».

07

Очистка

После ответа таблица исчезает вместе с обработкой запроса. Метку, которую модель придумала сама, сервис удаляет из текста — в документ она не попадёт.

Категории данных

Что распознаётся

Пример показывает результат на строке договора: метки в нём приведены в читаемом виде, в самом запросе они выглядят как ⟦PER1⟧ и ⟦PHONE1⟧

Что уходит в модельЗаменяем данные

Договор с Ивановым Иваном Ивановичем, тел. +7 999 123-45-67

Заменяется на метки
Имена и фамилии[ФИО]Организации[ОРГАНИЗАЦИЯ]Телефоны[ТЕЛЕФОН]Электронная почта[EMAIL]СНИЛС, ИНН, ОГРН[РЕКВИЗИТЫ]Паспорт, карты, счета[ДОКУМЕНТ]
  • ФИО и формы имёнв любом падеже
  • Названия организацийс формой юрлица и без
  • Электронная почта
  • Телефоны
  • СНИЛС
  • ИНН
  • ОГРН и ОГРНИП
  • Паспорт РФсерия и номер
  • Банковские карты
  • Номера счетов

Свой список компании

Внутренние названия, кодовые обозначения проектов, номера договоров и отраслевые обозначения распознаванию неизвестны — их добавляют в словарь компании в настройках приватности. Слова из словаря скрываются наравне с остальными данными и имеют приоритет над автоматическим поиском.

Где хранятся данные

Таблица соответствия

Связь «метка → исходное значение» нужна только для обратной замены и не покидает наш сервер

Живёт ровно один запрос

Пары «метка → исходное значение» существуют столько, сколько обрабатывается запрос: в памяти того процесса, который его выполняет. В базу данных, кеш и файлы журнала они не попадают, и службе распознавания не передаются.

Кеширование результатов распознавания по умолчанию отключено именно поэтому: в результатах содержится текст найденных сущностей, а значит кеш стал бы ещё одним хранилищем персональных данных.

Если модель вернёт метку, которой в таблице нет, сервис удалит её из текста. Пользователь не увидит в документе непонятных обозначений, а сервис не будет угадывать, какое значение подставить.

Границы применения

Скрытие данных включается в настройках приватности. В компании настройка одна на всех сотрудников и все проекты — её задаёт владелец или администратор; личная настройка действует только там, где компания не выбрана.

Есть операции, где данные скрывать нельзя по существу задачи: например, оформление списка литературы работает с фамилиями авторов — заменив их метками, корректную ссылку получить невозможно. Такие операции описаны в настройках, и их набор не меняется без предупреждения.

Автоматическое распознавание не даёт абсолютной полноты: редкие написания и внутренние обозначения без словаря компании могут остаться незамеченными. Поэтому в редакторе есть режим предпросмотра — он показывает, что именно будет скрыто в конкретном тексте, ничего не отправляя.

Контроль и локализация

Что фиксируется и где обрабатывается

Журнал подтверждает, что защита сработала, а сами данные остаются в российском контуре

Журнал

Для запросов с включённым скрытием данных фиксируется:

  • дата, время и идентификатор запроса
  • пользователь, компания и выбранный режим генерации
  • сколько сущностей найдено по каждому типу — без самих значений
  • факт замены и обратной подстановки
  • результат обработки и технический статус

Журнал нужен для разбора инцидентов и подтверждения того, что защита сработала. Сами персональные данные в него не пишутся.

Где обрабатываются данные

Поиск персональных данных, таблица соответствия, обратная замена и хранение документов выполняются на серверах в Российской Федерации. Служба распознавания доступна только из внутренней сети и в интернет не публикуется. За пределы этого контура уходит обезличенный запрос без сведений, по которым можно восстановить личность.

Такое разделение поддерживает требование части 5 статьи 18 152-ФЗ о локализации баз данных, где содержатся персональные данные граждан России.

Компаниям с более строгими требованиями сервис устанавливается на их собственные серверы: тогда документы и персональные данные не покидают внутреннюю сеть, а при размещении языковой модели в том же контуре внешние подключения не нужны совсем. Установка в контуре компании.

Документы

Поручение на обработку

Для корпоративных клиентов условия обработки закрепляются отдельным документом

В поручении на обработку персональных данных определяются:

  • цели обработки, категории данных и перечень операций
  • требования к защите данных и порядку их хранения
  • условия привлечения провайдеров языковых моделей
  • сроки хранения, удаления и порядок уведомления об инцидентах
  • какие сведения предоставляются для проверки

Запросить документы можно по адресу support@a4doc.ai.

Оператор и контакты

Оператор
ООО «А4док»
ОГРН
1251600036181
ИНН
1650446556
Нормативный акт
Закон № 152-ФЗ

На странице описаны технические и организационные меры, которыми A4doc обеспечивает работу с требованиями 152-ФЗ. Она не заменяет политику обработки персональных данных и условия договора.

Часто задаваемые вопросы

При включённом скрытии данных — нет. Имена, телефоны, почта, реквизиты и номера документов заменяются метками до того, как запрос уйдёт провайдеру. Таблица соответствия «метка → значение» остаётся на нашей стороне и модели не передаётся, а в готовый документ значения подставляются обратно.
Остались вопросы?Напишите нам