中文

基于层次边界建模定位音视频深度伪造

声音 2025-08-05 v1 计算机视觉与模式识别 音频与语音处理 图像与视频处理

摘要

在内容驱动的部分操纵场景下,音视频时序深度伪造的局部定位仍是一个高度具有挑战性的任务。在此场景中,深度伪造区域通常仅跨越数帧,其余大部分区域与原始内容完全相同。为解决此问题,我们提出了层次边界建模网络 (HBMNet),包括三个模块:用于提取判别性帧级表示的音视频特征编码器、用于预测候选边界区域的粗糙提议生成器,以及使用双向边界-内容概率细化这些提议的细粒度概率生成器。从模态角度看,我们通过专门的编码和融合来增强音视频学习,借助帧级监督提升判别性。从时序角度看,HBMNet 集成了多尺度线索和双向边界-内容关系。实验表明,编码和融合主要改善了精确度,而帧级监督则提升了召回率。每个模块(音视频融合、时间尺度、双向性)均提供互补的益处,整体上增强了局部化性能。HBMNet 在 BA-TFD 和 UMMAFormer 上的表现均优于后者,并显示出随更多训练数据而提升的潜在可扩展性。

关键词

引用

@article{arxiv.2508.02000,
  title  = {Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling},
  author = {Xuanjun Chen and Shih-Peng Cheng and Jiawei Du and Lin Zhang and Xiaoxiao Miao and Chung-Che Wang and Haibin Wu and Hung-yi Lee and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2508.02000},
  year   = {2025}
}

备注

Work in progress