RTCFake: 面向实时通信场景的语音深度伪造检测
声音
2026-04-28 v1
摘要
随着语音生成技术的快速发展,语音深度伪造在实时通信 (RTC) 场景中的威胁日益加剧。然而,现有检测研究主要关注离线仿真,难以应对RTC传输过程中引入的复杂失真,包括未知的语音增强过程(如噪声抑制)和编解码压缩。为此,我们提出了面向RTC场景的第一个大规模语音深度伪造数据集,称为\textit{RTCFake},总计约600小时。该数据集通过通过多个主流社交媒体和会议平台(如Zoom)传输语音,实现离线语音与在线语音的精确配对。在此基础上,我们提出了一种基于音素引导的一致性学习 (PCL) 策略,强制模型学习平台无关的语义结构表示。本文将\textit{RTCFake} 数据集划分为训练、开发和评估集,其中评估集包括未见过的RTC平台和未见过的复杂噪声条件,从而为语音深度伪造检测提供更真实、更具挑战性的评估基准。进一步地,所提出的PCL策略在跨平台泛化和噪声鲁棒性方面取得显著提升,为一种有效且通用的建模范式。\textit{RTCFake} 数据集已提供至 {https://huggingface.co/datasets/JunXueTech/RTCFake}。
引用
@article{arxiv.2604.23742,
title = {RTCFake: Speech Deepfake Detection in Real-Time Communication},
author = {Jun Xue and Zhuolin Yi and Yihuan Huang and Yanzhen Ren and Yujie Chen and Cunhang Fan and Zicheng Su and Yonghong Zhang and Bo Cai},
journal= {arXiv preprint arXiv:2604.23742},
year = {2026}
}
备注
Accepted by ACL 2026