中文

HOLA: 通过层次上下文聚合和高效预训练提升音视频深度伪造检测

计算机视觉与模式识别 2025-07-31 v1

摘要

生成式 AI 的进步正在使视频级深度伪造检测变得越来越具挑战性,暴露了当前检测技术的局限性。本文提出了 HOLA 作为我们解决方案,用于 2025 年 1M-Deepfakes Detection 挑战的视频级深度伪造检测赛道。灵感来源于通用领域中大规模预训练的成功,我们首先对音视频自监督预训练进行规模化,以实现视频级深度伪造检测的统一两阶段框架。具体而言,HOLA 包含一个迭代感知的跨模态学习模块,用于选择性音视频交互,采用局部-全局视角进行层次上下文建模和带门控聚合,以及用于尺度感知跨粗细语义增强的金字塔式细化器。此外,我们提出了伪监督 singal 注入策略进一步提升模型性能。广泛的实验表明,我们提出的 HOLA 在专家模型和 MLLMs 中效果显著。我们还进行了一系列消融研究,以探讨所引入组件的关键设计因素。值得注意的是,我们的 HOLA 在 TestA 集合上排名第 1,超过第二名 0.0476 的 AUC。

关键词

引用

@article{arxiv.2507.22781,
  title  = {HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training},
  author = {Xuecheng Wu and Danlei Huang and Heli Sun and Xinyi Yin and Yifan Wang and Hao Wang and Jia Zhang and Fei Wang and Peihao Guo and Suyu Xing and Junxiao Xue and Liang He},
  journal= {arXiv preprint arXiv:2507.22781},
  year   = {2025}
}