FMFCC-A:一个用于合成语音检测的具挑战性中文数据集
声音
2021-10-19 v1 人工智能
音频与语音处理
摘要
随着文本到语音(TTS)和语音转换(VC)技术的日益发展,合成语音的检测受到了严重影响。为了促进针对中文 TTS 和 VC 技术的合成语音检测模型的发展,我们构建了一个具挑战性的中文数据集,并组织了中国图象图形学会首届伪造媒体取证挑战赛(FMFCC-A)的配套音频赛道。FMFCC-A 数据集是目前公开可用的最大中文合成语音检测数据集,包含由 11 个中文 TTS 系统和两个中文 VC 系统生成的 40,000 条合成中文话语,以及从 58 位说话人收集的 10,000 条真实中文话语。FMFCC-A 数据集被划分为训练集、开发集和评估集,用于研究在各种先前未知的语音合成系统或音频后处理操作下的合成中文语音检测。除了描述 FMFCC-A 数据集的构建外,我们还对 FMFCC-A 的两种基线方法和表现优异的提交进行了详细分析,说明了 FMFCC-A 数据集的实用性与挑战性。我们希望 FMFCC-A 数据集能够填补合成语音检测领域缺乏中文数据集的空白。
引用
@article{arxiv.2110.09441,
title = {FMFCC-A: A Challenging Mandarin Dataset for Synthetic Speech Detection},
author = {Zhenyu Zhang and Yewei Gu and Xiaowei Yi and Xianfeng Zhao},
journal= {arXiv preprint arXiv:2110.09441},
year = {2021}
}