在语音转换与持续时间预测器改进后应用 ASV 进行语音识别
声音
2024-06-28 v1 人工智能
音频与语音处理
摘要
生物识别领域的关键组件之一是基于说话人语音的自动说话人验证系统 (ASV)。可以在孤立使用或与其他人工智能模型联合使用。在当代时代,神经网络的质量和数量正在呈指数级增长。同时,越来越多的系统旨在通过语音转换和文本转语音模型来操纵数据。语音生物识别伪造领域受到诸多挑战的帮助,包括 SSTC、ASVSpoof 和 SingFake。本文提出了一个自动说话人验证系统。我们的模型的主要目标是从目标说话人的音频中提取嵌入,以获取关于其语音特征(如基调、能量和音素持续时间)的信息。这一信息用于我们的多语音 TTS 管道中,该管道目前正在开发中。然而,该模型被用于 SSTC 挑战中,对经历语音转换的语音进行验证时,表现出 EER 为 20.669。
引用
@article{arxiv.2406.19243,
title = {Application of ASV for Voice Identification after VC and Duration Predictor Improvement in TTS Models},
author = {Borodin Kirill Nikolayevich and Kudryavtsev Vasiliy Dmitrievich and Mkrtchian Grach Maratovich and Gorodnichev Mikhail Genadievich and Korzh Dmitrii Sergeevich},
journal= {arXiv preprint arXiv:2406.19243},
year = {2024}
}