听说深度伪造检测:超越说话中心化伪造分析的新视角
计算机视觉与模式识别
2026-04-15 v1 多媒体
摘要
现有的深度伪造检测研究主要聚焦于操纵主体正在说话的场景,即通过改变说话者的外观或语音来生成虚构内容。然而,在真实的交互场景中,攻击者往往在虚假的说话和倾听状态之间交替,以误导其目标,从而增强场景的真实性和说服力。尽管'听说深度伪造'的检测仍然基本未被探索,且受限于数据集和方法的稀缺,听说伪造相对较低的质量为当前深度伪造检测提供了极佳的突破机会。本文提出了听说深度伪造检测(LDD)任务。我们引入ListenForge,第一个专为该任务设计的数据集,使用五种听说头生成(LHG)方法构建。为解决听说伪造的独特特征,我们提出了MANet(Motion-aware and Audio-guided Network),该网络捕捉听者视频中细微的运动不一致性,同时利用说话者的音频语义指导跨模态融合。广泛的实验表明,现有的说话深度伪造检测模型在听说场景中表现不佳。相比之下,MANet 在 ListenForge 上实现了显著优于的性能。我们的工作凸显了超越传统说话中心化范式重新思考深度伪造检测的必要性,为交互式通信设置中的多模态伪造分析开辟了新的方向。该数据集和代码均可在 https://anonymous.4open.science/r/LDD-B4CB 上获取。
引用
@article{arxiv.2604.12650,
title = {Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis},
author = {Miao Liu and Fangda Wei and Jing Wang and Xinyuan Qian},
journal= {arXiv preprint arXiv:2604.12650},
year = {2026}
}
备注
Submitted to ACMMM 2026