中文

HumanSAM:用于分类人类空间、外观和运动异常的人类中心伪造视频

计算机视觉与模式识别 2025-08-04 v2

摘要

尤其是模拟真实人类动作的人类中心合成视频数量众多,构成了对人类信息安全和真实性的重大威胁。虽然在二分类伪造视频检测方面取得了进展,但缺乏对伪造类型的细粒度理解仍引发了可靠性和可解释性的顾虑,这在实际应用中至关重要。为此,我们提出了 HumanSAM—a 一种新框架,基于视频生成模型的基本挑战。具体而言,HumanSAM 旨在将人类中心伪造视频分类为三类常见于生成内容的伪造类型:空间异常、外观异常和运动异常。为更好地捕获几何、语义和时空一致性特征,我们提出通过融合两种视频理解分支和空间深度来生成人类伪造表示。我们还采用基于排名的置信度增强策略,以引入三个先验分数来学习更稳健的表示。在训练和评估方面,我们构建了第一个公开基准——人类中心伪造视频 (Human-centric Forgery Video, HFV) 数据集,所有伪造类型均经过仔细标注。实验表明,HumanSAM 在与最先进方法的比较中,二分类和多分类伪造视频检测均取得了令人满意的成绩。

关键词

引用

@article{arxiv.2507.19924,
  title  = {HumanSAM: Classifying Human-centric Forgery Videos in Human Spatial, Appearance, and Motion Anomaly},
  author = {Chang Liu and Yunfan Ye and Fan Zhang and Qingyang Zhou and Yuchuan Luo and Zhiping Cai},
  journal= {arXiv preprint arXiv:2507.19924},
  year   = {2025}
}

备注

ICCV 2025. Project page: https://dejian-lc.github.io/humansam/