中文

留意那些话语:基于词条件面部运动的视频伪造检测

计算机视觉与模式识别 2022-12-05 v2 人工智能 计算与语言 密码学与安全 多媒体

摘要

在当今数字虚假信息时代,我们日益面临视频伪造技术带来的新威胁。此类伪造从 cheapfakes(如替身或音频配音)到 deepfakes(如复杂的 AI 媒体合成方法)不等,正变得在感知上与真实视频难以区分。为应对这一挑战,我们提出了一种多模态语义取证方法,以发现超越视觉质量差异检测的线索,从而同时处理较简单的 cheapfakes 与视觉上具有欺骗性的 deepfakes。本工作中,我们的目标是通过检测与所说话语相对应的异常面部运动,来验证视频中宣称出现的人确为其本人。我们利用归因思想来学习区分给定说话人与其他人的人物特定生物特征模式。我们使用可解释的动作单元(AUs)来捕捉人物的面部与头部运动,而非深度 CNN 特征,并且我们首次使用了词条件面部运动分析。我们进一步展示了我们的方法在一系列训练时未见的伪造(包括无视频操控的伪造)上的有效性,这些是先前工作所未涉及的。

关键词

引用

@article{arxiv.2112.10936,
  title  = {Watch Those Words: Video Falsification Detection Using Word-Conditioned Facial Motion},
  author = {Shruti Agarwal and Liwen Hu and Evonne Ng and Trevor Darrell and Hao Li and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2112.10936},
  year   = {2022}
}

备注

Accepted in WACV 2023