HQ-MPSD:用于部分深度伪造语音检测的多语言制造品控制基准
声音
2025-12-16 v1
摘要
部分深度伪造语音检测具有挑战性,因为人为操纵仅发生在短暂区域,而周围音频保持真实。然而,现有检测方法受限于可用数据集的质量,许多数据集依赖已过时的合成系统和生成程序,这些系统引入数据集特定的制造品,而非真实的人为操纵线索。为弥合这一差距,本文引入HQ-MPSD——高质量多语言部分深度伪造语音数据集。HQ-MPSD采用源自细粒度强制对齐的语言连贯splice点构建,保留语音的韵律和语义连续性,最小化可听和视觉边界制造品。该数据集包含8种语言、550名说话人,总时长350.8小时,加入背景音效以更贴近真实语音环境。MOS评估和声谱图分析均确认样本的高感知自然性。我们对当前最先进的检测模型进行了跨语言和跨数据集评估,所有模型在HQ-MPSD上的性能下降超过80%。这些结果表明,HQ-MPSD在去除低级制造品并引入多语言和声学多样性后,暴露了显著的泛化挑战,为部分深度伪造检测提供了更真实且更具挑战性的基准。该数据集可在https://zenodo.org/records/17929533访问。
引用
@article{arxiv.2512.13012,
title = {HQ-MPSD: A Multilingual Artifact-Controlled Benchmark for Partial Deepfake Speech Detection},
author = {Menglu Li and Majd Alber and Ramtin Asgarianamiri and Lian Zhao and Xiao-Ping Zhang},
journal= {arXiv preprint arXiv:2512.13012},
year = {2025}
}
备注
6 pages, 4 figures, 2 tables