防御合成语音:实时检测RVC语音转换攻击
声音
2026-01-09 v1 人工智能
音频与语音处理
摘要
生成式音频技术现在能够实现高度逼真的声纹克隆和实时语音转换,增加了在电话和视频通话等通信渠道中进行冒充、欺诈和误导的风险。本研究探讨了针对使用检索式语音转换(RVC)生成的人工智能语音的实时检测,评估基于DEEP-VOICE数据集的检测性能,该数据集包含来自多个知名说话人的真实语音和转换后语音样本。为模拟真实情况,深度伪造生成应用于声学成分的孤立部分,然后重新引入背景环境以抑制平凡伪影并突出转换特有的线索。我们将检测建模为流式分类任务,通过将音频划分为一秒的片段,提取时频和声谱特征,并训练受监督的机器学习模型以分类每个片段为真实或转换语音。该系统实现低延迟推理,支持片段级别决策和呼叫级别聚合。实验结果表明,短时声学特征能够可靠捕捉与RVC语音相关的判别性模式,即使在噪声背景下亦然。这些发现表明了实际、实时深度伪造语音检测的可行性,强调在实际音频混合条件下进行评估对于稳健部署的重要性。
引用
@article{arxiv.2601.04227,
title = {Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks},
author = {Prajwal Chinchmalatpure and Suyash Chinchmalatpure and Siddharth Chavan},
journal= {arXiv preprint arXiv:2601.04227},
year = {2026}
}