面向亚洲非母语语音的语音伪造检测:印尼语与泰语案例研究
音频与语音处理
2024-12-03 v1
摘要
本研究聚焦于构建针对非母语语音的有效伪造反制措施 (CM),具体目标为印尼语和泰语说话者。我们构建了一个包含母语与非母语语音的数据集以便进行研究。从语音数据中提取了三个关键特征 (MFCC、LFCC 和 CQCC),并采用三个经典机器学习分类器 (CatBoost、XGBoost 和 GMM) 开发了基于母语和组合 (母语与非母语) 语音数据的稳健伪造检测系统。这导致两种类型的 CM:本地 CM 和组合 CM。对这两种 CM 的性能在母语和非母语语音数据集上进行了评估。我们的发现揭示了本地 CM 在处理非母语语音时面临的显挑战,凸显了针对特定领域解决方案的必要性。该方法显示出 improved 的检测能力,表明将非母语语音数据纳入训练过程的重要性。本工作为在多样化语言语境下构建更有效的伪造检测系统奠定了基础。
引用
@article{arxiv.2412.01040,
title = {Detecting Spoof Voices in Asian Non-Native Speech: An Indonesian and Thai Case Study},
author = {Aulia Adila and Candy Olivia Mawalim and Masashi Unoki},
journal= {arXiv preprint arXiv:2412.01040},
year = {2024}
}