FTFDNet:通过三模态交互学习检测说话人脸视频篡改
计算机视觉与模式识别
2023-07-11 v1
摘要
基于DeepFake的数字人脸伪造正威胁公共媒体安全,尤其当说话人脸生成中使用了唇部篡改时,虚假视频的检测难度进一步提高。此类虚假说话人脸视频仅改变唇形以匹配给定语音,身份的人脸特征难以辨别。加之缺乏对音频流作为先验知识的关注,虚假说话人脸视频的检测失败也变得不可避免。研究发现,虚假说话人脸视频的光流尤其是唇部区域是紊乱的,而真实视频的光流变化规律,这意味着来自光流的运动特征有助于捕捉篡改线索。本研究提出一种虚假说话人脸检测网络(FTFDNet),通过高效跨模态融合(CMF)模块整合视觉、音频与运动特征。此外,提出一种新颖的视听注意力机制(AVAM)以发掘更具信息量的特征,该机制可通过模块化无缝集成到任意视听CNN架构中。借助额外的AVAM,所提出的FTFDNet不仅在自建的虚假说话人脸检测数据集(FTFDD)上,也在DeepFake视频检测数据集(DFDC与DF-TIMIT)上取得了优于其他最先进SOTA DeepFake视频检测方法的检测性能。
引用
@article{arxiv.2307.03990,
title = {FTFDNet: Learning to Detect Talking Face Video Manipulation with Tri-Modality Interaction},
author = {Ganglai Wang and Peng Zhang and Junwen Xiong and Feihan Yang and Wei Huang and Yufei Zha},
journal= {arXiv preprint arXiv:2307.03990},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2203.05178