MOS-FAD:通过自动平均主观意见分预测改进虚假音频检测
音频与语音处理
2024-01-26 v2 多媒体
摘要
自动平均主观意见分(MOS)预测被用于评估合成语音的质量。本研究将预测的MOS扩展应用于虚假音频检测(FAD)任务,因为我们期望MOS可用于评估合成语音与自然人声的接近程度。我们提出了MOS-FAD,其中MOS可在FAD的两个关键环节加以利用:训练数据选择和模型融合。在训练数据选择中,我们证明了MOS能够有效地从不平衡数据集中过滤样本。在模型融合中,我们的结果表明,将MOS作为FAD模型融合中的门控机制可提升整体性能。
引用
@article{arxiv.2401.13249,
title = {MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction},
author = {Wangjin Zhou and Zhengdong Yang and Chenhui Chu and Sheng Li and Raj Dabre and Yi Zhao and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2401.13249},
year = {2024}
}
备注
Accepted in ICASSP2024