Учёные из института AIRI, МТУСИ и «Сколтеха» представили новую ИИ‑модель для борьбы с голосовым мошенничеством
Специалисты института AIRI, МТУСИ и «Сколтеха» предложили новую модель искусственного интеллекта детекции поддельных сгенерированных голосов под названием AASIST3. Модель применима для противодействия голосовому мошенничеству и повышения безопасности систем, использующих голосовую аутентификацию. Работа была представлена на одной из наиболее известных научных конференций в сфере автоматической обработки речи Interspeech 2024, прошедшей на острове Кос (Греция). Представленная архитектура вошла в топ-10 лучших решений международного соревнования ASVspoof 2024 Challenge.
По словам специалистов из научной группы разработки модели AASIST3, системы голосовой биометрии помогают идентифицировать людей на основе их голосовых характеристик. Такие системы используют для аутентификации пользователей при проведении финансовых транзакций и в эксклюзивном контроле доступа в смарт‑устройствах. Кроме того, системы голосовой биометрии можно задействовать в противодействии телефонному мошенничеству нового поколения.
Однако модели распознавания голоса могут быть уязвимы к состязательным атакам. Для того чтобы провести атаку, надо определённым образом настроить небольшое изменение входного аудио, приводящее к значительному отличию результатов работы модели. При этом для человека это изменение будет незаметно или незначительно. Чтобы обойти системы безопасности, злоумышленники научились генерировать синтетический голос с помощью преобразования текста в речь (text‑to‑speech, TTS) и преобразования голоса (voice conversion, VC). Для эффективного противодействия озвученным атакам необходимо внедрение систем защиты от подмены голоса.
ИИ‑модель AASIST для анализа аудиоряда была продемонстрирована коллективом учёных из Южной Кореи и Франции в
Читать на habr.com
