Соответствие 152-ФЗ
A4doc работает с требованиями Федерального закона № 152-ФЗ «О персональных данных». Прямые идентификаторы скрываются до того, как текст уйдёт в языковую модель, а исходные значения остаются на нашей стороне и подставляются обратно уже в готовый документ.
Кратко
Сервис стоит между документом и внешней языковой моделью: обезличивает текст до отправки и возвращает данные обратно после ответа
Сервис находит в тексте прямые идентификаторы и заменяет их метками. Происходит это на нашем сервере, до того как запрос сформирован.
Языковая модель получает текст с метками: без имён, телефонов, почты, реквизитов и номеров документов, которые удалось распознать.
Метки в ответе заменяются обратно на исходные значения — с тем же падежом и написанием. Пользователь видит документ без изменений.
Остаётся факт замены и количество найденных сущностей по типам. Сами значения в журнал не пишутся.
Такая схема отделяет исходные персональные данные от вычислительных мощностей внешнего провайдера: прямые идентификаторы граждан России ему не передаются.
На чём построена защита
Пять правил, по которым сервис обращается с персональными данными в каждом запросе
Минимум данных наружу
Внешней модели передаётся только то, что нужно для задачи. Прямые идентификаторы заменяются метками, а не отправляются «на всякий случай».
Одна сущность — одна метка
Все упоминания одного человека получают один номер, даже если он назван в разных падежах или сокращённо. Модель понимает, кто участник, не зная его имени.
Обратная замена только у нас
Связь «метка → исходное значение» существует только на нашей стороне и не передаётся ни модели, ни службе распознавания.
Отказ вместо утечки
Если распознавание недоступно, запрос в модель не отправляется, а пользователь получает сообщение об ошибке. Отправить текст без маскирования сервис не может.
Проверяемость
Факт маскирования и количество найденных сущностей фиксируются в журнале. Значения ПДн туда не попадают, поэтому журнал не становится вторым хранилищем данных.
Как работает скрытие данных
Замена происходит до того, как запрос попадёт куда-либо ещё — к провайдеру, в историю запросов или в отладочные записи
Запрос принят
Текст запроса и материалы проекта остаются на нашем сервере.
Поиск данных
Формальные шаблоны находят почту, телефоны, ИНН, СНИЛС, ОГРН, номера карт и документов. Имена людей и названия организаций находит служба распознавания, которая работает во внутренней сети и наружу не публикуется.
Замена на метки
Найденные значения заменяются метками вида ⟦PER1⟧, ⟦PHONE1⟧, ⟦EMAIL1⟧. Повторные упоминания того же человека получают номер вхождения: ⟦PER1.2⟧.
Запрос к модели
Провайдер получает подготовленный текст. В историю запросов сервиса тоже сохраняется уже обезличенный вариант.
Таблица соответствия
Пары «метка → значение» живут в памяти процесса, который обрабатывает запрос. В базу, кеш и логи они не попадают.
Обратная замена
В ответе модели на место каждой метки подставляется ровно та подстрока, которую заменили. Поэтому падеж и написание сохраняются: «Иванову Ивану» останется «Иванову Ивану».
Очистка
После ответа таблица исчезает вместе с обработкой запроса. Метку, которую модель придумала сама, сервис удаляет из текста — в документ она не попадёт.
Что распознаётся
Пример показывает результат на строке договора: метки в нём приведены в читаемом виде, в самом запросе они выглядят как ⟦PER1⟧ и ⟦PHONE1⟧
Договор с Ивановым Иваном Ивановичем, тел. +7 999 123-45-67
- ФИО и формы имён — в любом падеже
- Названия организаций — с формой юрлица и без
- Электронная почта
- Телефоны
- СНИЛС
- ИНН
- ОГРН и ОГРНИП
- Паспорт РФ — серия и номер
- Банковские карты
- Номера счетов
Свой список компании
Внутренние названия, кодовые обозначения проектов, номера договоров и отраслевые обозначения распознаванию неизвестны — их добавляют в словарь компании в настройках приватности. Слова из словаря скрываются наравне с остальными данными и имеют приоритет над автоматическим поиском.
Таблица соответствия
Связь «метка → исходное значение» нужна только для обратной замены и не покидает наш сервер
Живёт ровно один запрос
Пары «метка → исходное значение» существуют столько, сколько обрабатывается запрос: в памяти того процесса, который его выполняет. В базу данных, кеш и файлы журнала они не попадают, и службе распознавания не передаются.
Кеширование результатов распознавания по умолчанию отключено именно поэтому: в результатах содержится текст найденных сущностей, а значит кеш стал бы ещё одним хранилищем персональных данных.
Если модель вернёт метку, которой в таблице нет, сервис удалит её из текста. Пользователь не увидит в документе непонятных обозначений, а сервис не будет угадывать, какое значение подставить.
Границы применения
Скрытие данных включается в настройках приватности. В компании настройка одна на всех сотрудников и все проекты — её задаёт владелец или администратор; личная настройка действует только там, где компания не выбрана.
Есть операции, где данные скрывать нельзя по существу задачи: например, оформление списка литературы работает с фамилиями авторов — заменив их метками, корректную ссылку получить невозможно. Такие операции описаны в настройках, и их набор не меняется без предупреждения.
Автоматическое распознавание не даёт абсолютной полноты: редкие написания и внутренние обозначения без словаря компании могут остаться незамеченными. Поэтому в редакторе есть режим предпросмотра — он показывает, что именно будет скрыто в конкретном тексте, ничего не отправляя.
Что фиксируется и где обрабатывается
Журнал подтверждает, что защита сработала, а сами данные остаются в российском контуре
Журнал
Для запросов с включённым скрытием данных фиксируется:
- дата, время и идентификатор запроса
- пользователь, компания и выбранный режим генерации
- сколько сущностей найдено по каждому типу — без самих значений
- факт замены и обратной подстановки
- результат обработки и технический статус
Журнал нужен для разбора инцидентов и подтверждения того, что защита сработала. Сами персональные данные в него не пишутся.
Где обрабатываются данные
Поиск персональных данных, таблица соответствия, обратная замена и хранение документов выполняются на серверах в Российской Федерации. Служба распознавания доступна только из внутренней сети и в интернет не публикуется. За пределы этого контура уходит обезличенный запрос без сведений, по которым можно восстановить личность.
Такое разделение поддерживает требование части 5 статьи 18 152-ФЗ о локализации баз данных, где содержатся персональные данные граждан России.
Компаниям с более строгими требованиями сервис устанавливается на их собственные серверы: тогда документы и персональные данные не покидают внутреннюю сеть, а при размещении языковой модели в том же контуре внешние подключения не нужны совсем. Установка в контуре компании.
Поручение на обработку
Для корпоративных клиентов условия обработки закрепляются отдельным документом
В поручении на обработку персональных данных определяются:
- цели обработки, категории данных и перечень операций
- требования к защите данных и порядку их хранения
- условия привлечения провайдеров языковых моделей
- сроки хранения, удаления и порядок уведомления об инцидентах
- какие сведения предоставляются для проверки
Запросить документы можно по адресу support@a4doc.ai.
Оператор и контакты
- Оператор
- ООО «А4док»
- ОГРН
- 1251600036181
- ИНН
- 1650446556
- Почта
- support@a4doc.ai
- Документ
- Политика обработки ПДн
- Нормативный акт
- Закон № 152-ФЗ
На странице описаны технические и организационные меры, которыми A4doc обеспечивает работу с требованиями 152-ФЗ. Она не заменяет политику обработки персональных данных и условия договора.