中文

用于深度伪造视频检测的锐利多示例学习

计算机视觉与模式识别 2020-08-12 v1 多媒体

摘要

随着面部操控技术的快速发展,出于安全考虑,人脸伪造在多媒体与计算机视觉领域受到广泛关注。现有方法大多针对使用精确图像级标签训练的单帧检测,或仅通过建模帧间不一致性进行视频级预测,给深度伪造(DeepFake)攻击者留下了潜在的高风险。本文引入深度伪造视频中局部人脸攻击这一新问题,其中仅提供视频级标签,而伪造视频中并非所有人脸都被篡改。我们通过多示例学习(multiple instance learning)框架解决该问题,将人脸和输入视频分别视为示例和包。提出了一种锐利 MIL(S-MIL),其建立从示例嵌入到包预测的直接映射,而非像传统 MIL 中那样从示例嵌入到示例预测再至包预测。理论分析证明,传统 MIL 中的梯度消失在 S-MIL 中得到缓解。为生成能准确包含局部被篡改人脸的示例,设计了时空编码示例以充分建模帧内与帧间不一致性,进一步助力提升检测性能。我们还构建了用于局部攻击深度伪造视频检测的新数据集 FFPMS,其有助于在帧和视频层级对不同方法进行评估。在 FFPMS 与广泛使用的 DFDC 数据集上的实验验证了 S-MIL 在局部攻击深度伪造视频检测上优于其他同类方法。此外,S-MIL 也可适配传统深度伪造图像检测任务,并在单帧数据集上取得最先进的性能。

关键词

引用

@article{arxiv.2008.04585,
  title  = {Sharp Multiple Instance Learning for DeepFake Video Detection},
  author = {Xiaodan Li and Yining Lang and Yuefeng Chen and Xiaofeng Mao and Yuan He and Shuhui Wang and Hui Xue and Quan Lu},
  journal= {arXiv preprint arXiv:2008.04585},
  year   = {2020}
}

备注

Accepted at ACM MM 2020. 11 pages, 8 figures, with appendix