ArFake:面向阿拉伯语欺骗语音检测的多方言基准与基线
计算与语言
2025-09-30 v1
摘要
随着生成式文本到语音模型的兴起,区分真实语音与合成语音变得具有挑战性,尤其对于研究关注度有限的阿拉伯语而言。大多数欺骗检测工作都集中在英语上,为阿拉伯语及其众多方言留下了显著空白。在本工作中,引入首个多方言阿拉伯语欺骗语音数据集。为了评估每个模型合成音频的难度,并确定哪个模型产生了最具挑战性的样本,旨在通过合并多个模型的音频或选择性能最佳的模型来指导最终数据集的构建,实施了一个评估流程,包括使用两种方法训练分类器:结合分类器头的现代嵌入方法;应用于MFCC特征的经典机器学习算法;以及RawNet2架构。该流程进一步纳入了基于人类评分的平均意见得分计算,以及通过自动语音识别模型处理原始和合成数据集以测量词错误率。结果表明,FishSpeech在卡萨布兰卡语料库上的阿拉伯语语音克隆方面优于其他TTS模型,产生了更真实且更具挑战性的合成语音样本。然而,依赖单一TTS进行数据集创建可能会限制泛化能力。
引用
@article{arxiv.2509.22808,
title = {ArFake: A Multi-Dialect Benchmark and Baselines for Arabic Spoof-Speech Detection},
author = {Mohamed Maged and Alhassan Ehab and Ali Mekky and Besher Hassan and Shady Shehata},
journal= {arXiv preprint arXiv:2509.22808},
year = {2025}
}