中文

AvatarShield: 用于以人为中心的合成视频检测的视觉强化学习

计算机视觉与模式识别 2025-09-24 v3 人工智能

摘要

人工智能生成内容的最新进展带来了高度逼真的合成视频,特别是在涉及语音、手势和全身运动的人为中心场景中,对信息真实性和公众信任构成严重威胁。与专注于局部面部操作的 DeepFake 技术不同,以人为中心的视频生成方法可以合成整个身体并实现可控运动,使其能够与环境、物体甚至其他人进行复杂交互。然而,现有检测方法大多忽视了此类全身合成内容日益增长的风险。与此同时,越来越多的研究探索利用大语言模型(LLM)进行可解释虚假检测,旨在以自然语言解释决策。然而,这些方法严重依赖监督微调,这会引入标注偏差、幻觉监督和泛化能力减弱等限制。为应对这些挑战,我们提出 AvatarShield,一个新颖的多模态以人为中心的合成视频检测框架,通过采用组相对策略优化(Group Relative Policy Optimization)消除了对密集文本监督的需求,使 LLM 能够从简单的二元标签中发展推理能力。我们的架构结合了用于高层语义不一致性的离散视觉塔和用于细粒度伪影分析的残差提取器。我们进一步引入 FakeHumanVid,一个大规模基准数据集,包含来自九种最先进的人体生成方法(由文本、姿态或音频驱动)的 15K 个真实和合成视频。大量实验表明,AvatarShield 在领域内和跨领域设置中均优于现有方法。

关键词

引用

@article{arxiv.2505.15173,
  title  = {AvatarShield: Visual Reinforcement Learning for Human-Centric Synthetic Video Detection},
  author = {Zhipei Xu and Xuanyu Zhang and Qing Huang and Xing Zhou and Jian Zhang},
  journal= {arXiv preprint arXiv:2505.15173},
  year   = {2025}
}