中文

从对话到唱歌:面向音视频深度伪造检测的新挑战

人工智能 2026-05-28 v1 多媒体 声音

摘要

随着音视频生成模型的快速发展,可靠的伪造检测日益紧迫。现有的音视频深度伪造检测方法通常依赖跨模态不一致性。在唱歌场景中,节奏化 vocalization 削弱了这种耦合,引入显著的领域迁移,严重降低检测性能。我们使用节奏感知生成模型构建了唱歌头部深度伪造(Singing Head DeepFake, SHDF)数据集,以填补唱歌基准测试的空白。为应对跨场景的领域迁移,我们提出了文本引导的音视频伪造检测(T-AVFD)框架,能够在对话和唱歌场景之间普适化。T-AVFD 包含面部真实性模式学习器和多模态差分权重学习模块。模式学习器将面部特征与多粒度文本描述对齐,以学习可泛化的真实性模式。权重学习模块保留内在的音视频一致性,并通过差分加权方式将其与真实性模式相结合。大量实验表明,在多个对话头部深度伪造数据集和 SHDF 上,T-AVFD 相对于现有基线方法均实现了一致的提升,并在多样化扰动下表现出强大的鲁棒性。

关键词

引用

@article{arxiv.2605.27944,
  title  = {From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection},
  author = {Ke Liu and Jiwei Wei and Wenyu Zhang and Shuchang Zhou and Ruikun Chai and Yutao Dai and Chaoning Zhang and Yang Yang},
  journal= {arXiv preprint arXiv:2605.27944},
  year   = {2026}
}

备注

Accepted by ICML 2026