通过面部动作单元提升音视频深度伪造检测
计算机视觉与模式识别
2025-06-17 v2
摘要
生成式AI的快速演进增加了逼真的音视频深度伪造的威胁,迫切需要稳健的检测方法。现有解决方案主要针对单模态(音频或视觉)伪造,但在处理多模态操纵时受限,主要是由于对异构模态特征的处理不足以及在数据集之间泛化能力差。为此,我们提出了一种新型框架,称为FauForensics,通过引入生物学不变的面部动作单元(FAU),这既是面部肌肉活动与情感生理学相关的量化描述符,又可作为伪造抗性的表示,减少领域依赖性的同时捕获常被合成内容破坏的细微动态。此外,与先前方法不同,我们的方法计算通过专门的融合模块增强的帧级音视频相似性。该模块使用可学习的跨模态查询,动态地对齐时间-空间 lip-音频关系,同时缓解多模态特征异构性问题。在FakeAVCeleb和LAV-DF上的实验显示,我们的方法在性能和跨数据集泛化能力方面均优于最先进方法,平均提升4.83%。
引用
@article{arxiv.2505.08294,
title = {FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units},
author = {Jian Wang and Baoyuan Wu and Li Liu and Qingshan Liu},
journal= {arXiv preprint arXiv:2505.08294},
year = {2025}
}