中文

基于音视觉注意的多模态网络用于伪造说话人脸视频检测

计算机视觉与模式识别 2022-03-11 v1 声音 音频与语音处理

摘要

基于 DeepFake 的数字人脸伪造正威胁公共媒体安全,尤其当说话人脸生成中使用了唇部操控时,虚假视频检测的困难进一步加剧。此类伪造说话人脸视频仅改变唇形以匹配给定语音,身份的人脸特征难以辨别。加之缺乏将音频流作为先验知识的关注,伪造说话人脸生成的检测失败也变得不可避免。受人类多感官感知系统决策机制启发——该机制使听觉信息增强后感官视觉证据以输出明智决策——本研究提出一种伪造说话人脸检测框架 FTFDNet,通过融合音频与视觉表征实现更精准的伪造说话人脸视频检测。此外,提出一种音视觉注意机制(AVAM)以发现更具信息量的特征,其可通过模块化无缝集成至任意音视觉 CNN 架构。借助附加的 AVAM,所提 FTFDNet 能在自建数据集(FTFDD)上取得更优检测性能。所提工作的评估显示其在伪造说话人脸视频检测上表现优异,检测率可达 97% 以上。

关键词

引用

@article{arxiv.2203.05178,
  title  = {An Audio-Visual Attention Based Multimodal Network for Fake Talking Face Videos Detection},
  author = {Ganglai Wang and Peng Zhang and Lei Xie and Wei Huang and Yufei Zha and Yanning Zhang},
  journal= {arXiv preprint arXiv:2203.05178},
  year   = {2022}
}