中文

迈向通用合成视频检测器:从人脸或背景篡改到全 AI 生成内容

计算机视觉与模式识别 2025-09-04 v2

摘要

现有的 DeepFake 检测技术主要关注人脸篡改,例如换脸或唇形同步。然而,文本到视频(T2V)和图像到视频(I2V)生成模型的进步现在允许生成完全由 AI 生成的合成内容以及无缝的背景更改,这挑战了以人脸为中心的检测方法,并要求更具通用性的方法。为了解决这个问题,我们引入了用于识别篡改与合成视频的通用网络(Universal Network for Identifying Tampered and synthEtic videos, UNITE)模型,与传统检测器不同,该模型能够捕捉全帧篡改。UNITE 将检测能力扩展到无人脸、非人类主体以及复杂背景修改的场景。它利用基于 Transformer 的架构,处理通过 SigLIP-So400M 基础模型从视频中提取的领域无关特征。鉴于包含人脸/背景更改和 T2V/I2V 内容的有限数据集,我们在训练中将任务无关数据与标准 DeepFake 数据集相结合。我们进一步通过引入注意力多样性(AD)损失来缓解模型过度关注人脸的倾向,该损失促进了跨视频帧的多样化空间注意力。将 AD 损失与交叉熵相结合,提升了各种情境下的检测性能。比较评估表明,在包含人脸/背景篡改和完全合成的 T2V/I2V 视频的数据集上(在跨数据设置中),UNITE 优于 state-of-the-art 检测器,展示了其适应性和泛化检测能力。

关键词

引用

@article{arxiv.2412.12278,
  title  = {Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated Content},
  author = {Rohit Kundu and Hao Xiong and Vishal Mohanty and Athula Balachandran and Amit K. Roy-Chowdhury},
  journal= {arXiv preprint arXiv:2412.12278},
  year   = {2025}
}