Fuzzy matching: как работает нечёткое сопоставление имён в санкционном скрининге

Fuzzy matching: как работает нечёткое сопоставление имён в санкционном скрининге

Fuzzy matching — это метод сравнения текстовых строк, который находит вероятные совпадения при опечатках, разной транслитерации и перестановке слов, рассчитывая оценку сходства вместо точного совпадения. В России применяется в рамках 115-ФЗ при скрининге клиентов по санкционным перечням и базам публичных должностных лиц (PEP). В отличие от точного сопоставления, которое признаёт совпадением только полностью идентичные записи, нечёткое сопоставление рассчитывает оценку сходства. Это позволяет выявить потенциальное совпадение даже при ошибках в данных и передать результат на ручную проверку.

Кратко:

Fuzzy matching — это метод сравнения текстовых строк, который вычисляет оценку сходства вместо точного совпадения. В России применяется в рамках 115-ФЗ при санкционном скрининге и PEP-проверке клиентов.

  • Точное сравнение ФИО не выявляет совпадения, если в записях есть опечатки, разный порядок слов или варианты транслитерации.
  • Расстояние Левенштейна, метрика Джаро–Винклера, фонетические алгоритмы и N-граммы решают разные задачи, поэтому их часто комбинируют.
  • Порог схожести определяет соотношение ложных срабатываний и пропущенных совпадений.
  • Высокая оценка сходства между данными клиента и записью в санкционном перечне служит сигналом для эскалации и ручной проверки комплаенс-специалистом. Она подтверждает текстовую близость, но не гарантирует, что обе записи относятся к одному человеку.
  • Нечёткое сопоставление входит в процесс проверки клиента по перечням и дополняется датой рождения, гражданством, ИНН и реквизитами документа.

Почему точное сопоставление (exact match) пропускает совпадения


Перечни Росфинмониторинга, списки иностранных юрисдикций и базы публичных должностных лиц собирают данные из разных источников. Поэтому имя одного человека может встречаться в нескольких вариантах. Например, «Natalia», «Nataliya» и «Nataliia» могут передавать одно имя по разным правилам транслитерации.

Расхождения возникают из-за ошибок при ручном вводе данных оператором, проблем с OCR-распознаванием документов, использования разных правил транслитерации, наличия составных фамилий или инициалов, а также изменения порядка имени и фамилии. Точное сравнение воспринимает такие записи как разные. В проверке по санкционным спискам такой подход повышает риск не выявить потенциальное совпадение.


Какие алгоритмы применяют для нечёткого сопоставления имён


Один алгоритм редко охватывает все варианты расхождений. Команда подбирает методы под язык, качество исходных данных и типичные ошибки в клиентской базе.

В основе алгоритмов лежат разные математические и лингвистические принципы. Метод Левенштейна использует динамическое программирование для поиска кратчайшего пути преобразования одной строки в другую. Метрика Джаро–Винклера опирается на транспозиции символов, дополнительно премируя совпадения в начале слова. Фонетические алгоритмы, такие как Soundex и Metaphone, применяют хеширование: они кодируют группы согласных звуков так, чтобы слова с похожим звучанием сводились к одному ключу. Метод N-грамм разбивает текст на перекрывающиеся токены фиксированной длины и рассчитывает сходство через коэффициенты пересечения множеств, например, меру Жаккара.

Алгоритм

Что измеряет

Где полезен

Ограничение

Расстояние Левенштейна

Число вставок, удалений и замен символов

Опечатки, лишние или пропущенные буквы

Не учитывает звучание имени

Метрика Джаро–Винклера

Сходство коротких строк с повышенным весом общего начала

Имена и фамилии

Может завышать оценку при одинаковом префиксе

Soundex и Metaphone

Фонетическую близость

Варианты написания по звучанию

Требуют адаптации к языку

N-граммы

Пересечение коротких фрагментов строки

Составные имена и частичные совпадения

Результат зависит от длины строки и размера фрагмента

Алгоритм возвращает оценку от 0 до 1 либо её процентное представление. Итоговый скоринг может объединять несколько оценок с дополнительными признаками: датой рождения, гражданством, ИНН и реквизитами документа.


Как порог влияет на ошибки


Порог схожести задаёт минимальную оценку, при которой система создаёт алерт. Низкий порог увеличивает число кандидатов на ручной разбор. Высокий сокращает поток алертов, но повышает вероятность пропущенного совпадения.

  • Ложное срабатывание (false positive): система связывает записи разных людей. Комплаенс-команда тратит время на проверку и закрытие алерта.
  • Пропущенное совпадение (false negative): система не поднимает алерт по записям одного человека. Такой результат снижает полноту скрининга.

Единого порога для всех баз нет. Его подбирают на размеченной выборке и пересматривают после анализа ошибок, изменений в алгоритме или составе данных. Порог для ФИО может отличаться от порога для названия компании или адреса.


Как нечёткое сопоставление встроено в процесс скрининга


Нечёткое сопоставление входит в общий процесс санкционного скрининга и PEP-проверки. Объём и периодичность проверки зависят от правового статуса организации, применимых перечней, нормативных актов и правил внутреннего контроля.

  • Собрать сведения о клиенте и привести их к единому формату.
  • Подготовить варианты написания для разных алфавитов и правил транслитерации.
  • Сравнить записи с применимыми перечнями и источниками.
  • Дополнить оценку сходства идентификаторами клиента.
  • Передать спорные случаи специалисту и зафиксировать решение.

Скрининг связан с другими процедурами AML и ПОД/ФТ и проверками в KYC-процессе. При онбординге клиента результаты сопоставления влияют на маршрут ручной проверки, но не заменяют идентификацию и оценку риска.


Как проверить качество настройки fuzzy matching


Качество сопоставления начинается с подготовки данных. Перед сравнением записи приводят к единому регистру, убирают лишние пробелы и знаки, унифицируют «е» и «ё», дефисы, инициалы и порядок частей имени. Для кириллицы и латиницы задают правила транслитерации. Клиентскую запись и запись из перечня обрабатывают одинаково, иначе алгоритм будет измерять различия в формате.

Порог проверяют на размеченной выборке с заранее известными совпадениями и несовпадениями. В неё включают опечатки, ошибки распознавания, перестановку имени и фамилии, составные фамилии и варианты транслитерации. После теста команда отдельно разбирает ложные срабатывания и пропущенные совпадения. Изменение порога проверяют на той же выборке, чтобы сопоставить результат до и после настройки.

Высокая оценка подтверждает близость строк, но не принадлежность записей одному человеку. Итоговый скоринг учитывает дополнительные идентификаторы. Спорные случаи передают специалисту. В журнале сохраняют исходные и нормализованные данные, версию алгоритма, порог, оценки признаков и принятое решение. Такая запись помогает восстановить ход проверки при внутреннем контроле или разборе алерта.


Чем отличаются точное и нечёткое сопоставление имён

Критерий

Точное сопоставление

Нечёткое сопоставление

Принцип

Посимвольное сравнение

Расчёт степени сходства

Опечатки

Приводят к несовпадению

Могут быть учтены

Транслитерация

Требует заранее подготовленных вариантов

Обрабатывается в сочетании с нормализацией и фонетическими методами

Риск пропуска

Выше при расхождении записи

Ниже при корректной настройке, но сохраняется

Ложные алерты

Обычно меньше

Зависят от порога и качества данных

Роль в скрининге

Подходит для точных идентификаторов

Помогает выявлять неточные совпадения


Как внедрить fuzzy matching в процесс скрининга


  • Описать типичные расхождения в данных и выбрать алгоритмы под каждый тип.
  • Зафиксировать правила нормализации и транслитерации.
  • Подготовить размеченную выборку и измерить долю выявленных совпадений и ложных алертов.
  • Установить пороги отдельно для разных полей и клиентских сегментов.
  • Добавить дату рождения, гражданство, ИНН и реквизиты документа в итоговый скоринг.
  • Закрепить порядок ручной проверки, эскалации и журналирования.
  • Повторять тестирование после изменения алгоритма, порогов или источников данных.

IDX применяет несколько алгоритмов нечёткого сопоставления и учитывает варианты транслитерации при санкционном скрининге и проверке публичных должностных лиц.

Правовая оценка процесса зависит от статуса организации, применимых перечней, нормативных актов и правил внутреннего контроля.

Актуально на . Последнее обновление: . Материал носит информационный характер и не является юридической консультацией.

Часто задаваемые вопросы

Что такое fuzzy matching в санкционном скрининге
Fuzzy matching — метод сравнения текстовых строк, который вычисляет оценку сходства от 0 до 1 вместо посимвольного совпадения. Он выявляет вероятные совпадения имён при опечатках, разных вариантах транслитерации и перестановке слов. Применяется в процессе проверки клиента по санкционным перечням и базам публичных должностных лиц (PEP), дополняя точное сравнение идентификаторов — даты рождения, гражданства, ИНН.
Кто обязан применять нечёткое сопоставление при проверке клиентов
Организации, подпадающие под требования 115-ФЗ о противодействии легализации доходов, полученных преступным путём, и финансированию терроризма — банки, МФО, брокеры, операторы электронных денег и другие субъекты первичного финансового мониторинга. Объём и периодичность скрининга по спискам Росфинмониторинга и иностранных юрисдикций зависят от правового статуса организации и применимых нормативных актов.
Почему точное сопоставление имён (exact match) пропускает совпадения
Точное сопоставление признаёт совпадением только полностью идентичные записи. Имя одного человека может встречаться в разных вариантах из-за ошибок ручного ввода, OCR-распознавания, разных правил транслитерации, составных фамилий или изменения порядка имени и фамилии — например, Natalia, Nataliya и Nataliia. Такие расхождения exact match интерпретирует как разные записи, что повышает риск не выявить совпадение при санкционной проверке.
Какие алгоритмы применяют для нечёткого сопоставления имён
Основные алгоритмы: расстояние Левенштейна (динамическое программирование, считает вставки, удаления и замены символов), метрика Джаро–Винклера (сходство коротких строк с премией за общий префикс), фонетические алгоритмы Soundex и Metaphone (хеширование по звучанию) и N-граммы (пересечение фрагментов строки, например через меру Жаккара). Команда комбинирует их под язык и качество данных.
Как порог схожести влияет на количество ложных срабатываний
Порог схожести задаёт минимальную оценку, при которой система создаёт алерт. Низкий порог увеличивает число ложных срабатываний (false positive), когда система связывает записи разных людей, и нагрузку на ручную проверку. Высокий порог сокращает поток алертов, но повышает риск пропущенного совпадения (false negative). Единого порога для всех баз нет — его подбирают на размеченной выборке и пересматривают после анализа ошибок.
Чем отличается ложное срабатывание от пропущенного совпадения при скрининге
Ложное срабатывание (false positive) — система связывает записи разных людей, и комплаенс-команда тратит время на проверку и закрытие алерта. Пропущенное совпадение (false negative) — система не поднимает алерт по записям одного человека, что снижает полноту скрининга. Порог схожести регулирует баланс между этими двумя типами ошибок отдельно для ФИО, названий компаний и адресов.
Как нечёткое сопоставление встроено в процесс проверки клиента по перечням
Процесс включает пять шагов: сбор сведений о клиенте и приведение их к единому формату, подготовку вариантов написания для разных алфавитов и правил транслитерации, сравнение записей с применимыми перечнями, дополнение оценки сходства идентификаторами клиента (дата рождения, гражданство, ИНН) и передачу спорных случаев специалисту с фиксацией решения. Скрининг связан с AML-процедурами и не заменяет идентификацию клиента в рамках KYC.
Как проверить качество настройки fuzzy matching
Качество начинается с нормализации данных: единый регистр, унификация «е»/«ё», дефисов и порядка частей имени, заданные правила транслитерации для кириллицы и латиницы. Порог проверяют на размеченной выборке с известными совпадениями и несовпадениями, включающей опечатки, ошибки OCR и варианты транслитерации. После теста разбирают ложные срабатывания и пропущенные совпадения, а изменения порога сверяют на той же выборке.
Чем нечёткое сопоставление отличается от точного сопоставления имён
Точное сопоставление — посимвольное сравнение, которое требует заранее подготовленных вариантов транслитерации и даёт меньше ложных алертов, но выше риск пропуска при расхождении записи. Нечёткое сопоставление рассчитывает степень сходства, обрабатывает транслитерацию в сочетании с нормализацией и фонетическими методами, снижает риск пропуска при корректной настройке, но требует контроля порога и качества данных.
Какие данные фиксируют в журнале проверки при санкционном скрининге
В журнале сохраняют исходные и нормализованные данные записи, версию алгоритма, применённый порог схожести, оценки признаков и итоговое решение по алерту. Такая запись позволяет восстановить ход проверки при внутреннем контроле, аудите комплаенс-процедур или разборе конкретного случая, что особенно важно при подтверждении соответствия требованиям 115-ФЗ.
Стать клиентом IDX
Ошибка! Сообщение не отправлено.
Спасибо за вашу заявку!
Наш менеджер свяжется с вами в ближайшее время
12.08.2026
Подмена личности на входе в сервис обошлась в 29,3 млрд рублей за 2025 год. Четыре проверки, которые меняют экономику атаки.
11.08.2026
Знаки 3–4 ИНН с 2026 года обозначают индекс ФНС. Валидаторы, сверяющие их со справочником инспекций, бракуют верные номера.
10.08.2026
Синтетический профиль соединяет подлинный СНИЛС или ИНН с вымышленной биографией и проходит проверку документа. Разбираем, чем он отличается от кражи личности, как выявить его при онбординге и что требует 115-ФЗ.
07.08.2026
Новости и ИИ • 1 августа–7 августа 2026 года. Дайджест регуляторных и рыночных новостей IDX
05.08.2026
Антифрод-онбординг продавца — это 3 уровня: реестры, биометрия, поведение. С 1 октября 2026 года 289-ФЗ обязывает проверять селлеров, но защита от дипфейков остаётся задачей маркетплейсов.
Подписка на новости