Fuzzy matching — это метод сравнения текстовых строк, который находит вероятные совпадения при опечатках, разной транслитерации и перестановке слов, рассчитывая оценку сходства вместо точного совпадения. В России применяется в рамках 115-ФЗ при скрининге клиентов по санкционным перечням и базам публичных должностных лиц (PEP). В отличие от точного сопоставления, которое признаёт совпадением только полностью идентичные записи, нечёткое сопоставление рассчитывает оценку сходства. Это позволяет выявить потенциальное совпадение даже при ошибках в данных и передать результат на ручную проверку.
Кратко:
Fuzzy matching — это метод сравнения текстовых строк, который вычисляет оценку сходства вместо точного совпадения. В России применяется в рамках 115-ФЗ при санкционном скрининге и PEP-проверке клиентов.
- Точное сравнение ФИО не выявляет совпадения, если в записях есть опечатки, разный порядок слов или варианты транслитерации.
- Расстояние Левенштейна, метрика Джаро–Винклера, фонетические алгоритмы и N-граммы решают разные задачи, поэтому их часто комбинируют.
- Порог схожести определяет соотношение ложных срабатываний и пропущенных совпадений.
- Высокая оценка сходства между данными клиента и записью в санкционном перечне служит сигналом для эскалации и ручной проверки комплаенс-специалистом. Она подтверждает текстовую близость, но не гарантирует, что обе записи относятся к одному человеку.
- Нечёткое сопоставление входит в процесс проверки клиента по перечням и дополняется датой рождения, гражданством, ИНН и реквизитами документа.
Почему точное сопоставление (exact match) пропускает совпадения
Перечни Росфинмониторинга, списки иностранных юрисдикций и базы публичных должностных лиц собирают данные из разных источников. Поэтому имя одного человека может встречаться в нескольких вариантах. Например, «Natalia», «Nataliya» и «Nataliia» могут передавать одно имя по разным правилам транслитерации.
Расхождения возникают из-за ошибок при ручном вводе данных оператором, проблем с OCR-распознаванием документов, использования разных правил транслитерации, наличия составных фамилий или инициалов, а также изменения порядка имени и фамилии. Точное сравнение воспринимает такие записи как разные. В проверке по санкционным спискам такой подход повышает риск не выявить потенциальное совпадение.
Какие алгоритмы применяют для нечёткого сопоставления имён
Один алгоритм редко охватывает все варианты расхождений. Команда подбирает методы под язык, качество исходных данных и типичные ошибки в клиентской базе.
В основе алгоритмов лежат разные математические и лингвистические принципы. Метод Левенштейна использует динамическое программирование для поиска кратчайшего пути преобразования одной строки в другую. Метрика Джаро–Винклера опирается на транспозиции символов, дополнительно премируя совпадения в начале слова. Фонетические алгоритмы, такие как Soundex и Metaphone, применяют хеширование: они кодируют группы согласных звуков так, чтобы слова с похожим звучанием сводились к одному ключу. Метод N-грамм разбивает текст на перекрывающиеся токены фиксированной длины и рассчитывает сходство через коэффициенты пересечения множеств, например, меру Жаккара.
|
Алгоритм |
Что измеряет |
Где полезен |
Ограничение |
|---|---|---|---|
|
Расстояние Левенштейна |
Число вставок, удалений и замен символов |
Опечатки, лишние или пропущенные буквы |
Не учитывает звучание имени |
|
Метрика Джаро–Винклера |
Сходство коротких строк с повышенным весом общего начала |
Имена и фамилии |
Может завышать оценку при одинаковом префиксе |
|
Soundex и Metaphone |
Фонетическую близость |
Варианты написания по звучанию |
Требуют адаптации к языку |
|
N-граммы |
Пересечение коротких фрагментов строки |
Составные имена и частичные совпадения |
Результат зависит от длины строки и размера фрагмента |
Алгоритм возвращает оценку от 0 до 1 либо её процентное представление. Итоговый скоринг может объединять несколько оценок с дополнительными признаками: датой рождения, гражданством, ИНН и реквизитами документа.
Как порог влияет на ошибки
Порог схожести задаёт минимальную оценку, при которой система создаёт алерт. Низкий порог увеличивает число кандидатов на ручной разбор. Высокий сокращает поток алертов, но повышает вероятность пропущенного совпадения.
- Ложное срабатывание (false positive): система связывает записи разных людей. Комплаенс-команда тратит время на проверку и закрытие алерта.
- Пропущенное совпадение (false negative): система не поднимает алерт по записям одного человека. Такой результат снижает полноту скрининга.
Единого порога для всех баз нет. Его подбирают на размеченной выборке и пересматривают после анализа ошибок, изменений в алгоритме или составе данных. Порог для ФИО может отличаться от порога для названия компании или адреса.
Как нечёткое сопоставление встроено в процесс скрининга
Нечёткое сопоставление входит в общий процесс санкционного скрининга и PEP-проверки. Объём и периодичность проверки зависят от правового статуса организации, применимых перечней, нормативных актов и правил внутреннего контроля.
- Собрать сведения о клиенте и привести их к единому формату.
- Подготовить варианты написания для разных алфавитов и правил транслитерации.
- Сравнить записи с применимыми перечнями и источниками.
- Дополнить оценку сходства идентификаторами клиента.
- Передать спорные случаи специалисту и зафиксировать решение.
Скрининг связан с другими процедурами AML и ПОД/ФТ и проверками в KYC-процессе. При онбординге клиента результаты сопоставления влияют на маршрут ручной проверки, но не заменяют идентификацию и оценку риска.
Как проверить качество настройки fuzzy matching
Качество сопоставления начинается с подготовки данных. Перед сравнением записи приводят к единому регистру, убирают лишние пробелы и знаки, унифицируют «е» и «ё», дефисы, инициалы и порядок частей имени. Для кириллицы и латиницы задают правила транслитерации. Клиентскую запись и запись из перечня обрабатывают одинаково, иначе алгоритм будет измерять различия в формате.
Порог проверяют на размеченной выборке с заранее известными совпадениями и несовпадениями. В неё включают опечатки, ошибки распознавания, перестановку имени и фамилии, составные фамилии и варианты транслитерации. После теста команда отдельно разбирает ложные срабатывания и пропущенные совпадения. Изменение порога проверяют на той же выборке, чтобы сопоставить результат до и после настройки.
Высокая оценка подтверждает близость строк, но не принадлежность записей одному человеку. Итоговый скоринг учитывает дополнительные идентификаторы. Спорные случаи передают специалисту. В журнале сохраняют исходные и нормализованные данные, версию алгоритма, порог, оценки признаков и принятое решение. Такая запись помогает восстановить ход проверки при внутреннем контроле или разборе алерта.
Чем отличаются точное и нечёткое сопоставление имён
|
Критерий |
Точное сопоставление |
Нечёткое сопоставление |
|---|---|---|
|
Принцип |
Посимвольное сравнение |
Расчёт степени сходства |
|
Опечатки |
Приводят к несовпадению |
Могут быть учтены |
|
Транслитерация |
Требует заранее подготовленных вариантов |
Обрабатывается в сочетании с нормализацией и фонетическими методами |
|
Риск пропуска |
Выше при расхождении записи |
Ниже при корректной настройке, но сохраняется |
|
Ложные алерты |
Обычно меньше |
Зависят от порога и качества данных |
|
Роль в скрининге |
Подходит для точных идентификаторов |
Помогает выявлять неточные совпадения |
Как внедрить fuzzy matching в процесс скрининга
- Описать типичные расхождения в данных и выбрать алгоритмы под каждый тип.
- Зафиксировать правила нормализации и транслитерации.
- Подготовить размеченную выборку и измерить долю выявленных совпадений и ложных алертов.
- Установить пороги отдельно для разных полей и клиентских сегментов.
- Добавить дату рождения, гражданство, ИНН и реквизиты документа в итоговый скоринг.
- Закрепить порядок ручной проверки, эскалации и журналирования.
- Повторять тестирование после изменения алгоритма, порогов или источников данных.
IDX применяет несколько алгоритмов нечёткого сопоставления и учитывает варианты транслитерации при санкционном скрининге и проверке публичных должностных лиц.
Правовая оценка процесса зависит от статуса организации, применимых перечней, нормативных актов и правил внутреннего контроля.