情感增强音视频特征提升深度伪造检测的泛化能力
人工智能
2026-05-20 v1
摘要
随着生成式AI模型的不断进步, forensics 面临日益增加的压力。新的生成技术不断涌现,无法为每一种操纵手段收集训练数据。因此,提升对训练期未见深度伪造的泛化能力是当前深度伪造检测研究的主要挑战之一。为解决这一挑战,我们利用高层次语义线索,认为这些线索可以支持低层次 focused 方法在泛化到未见操纵类型方面。本文研究情感作为高层次语义线索。我们提出Emo-Boost,一种多模态深度伪造检测框架,将即插即用的RGB和声音focused深度伪造检测器与我们的情感based深度伪造检测器EmoForensics融合。EmoForensics利用视觉和音频情感识别模块,模型化情感表示在音视频流中的局部和跨模态时间一致性。我们发现EmoForensics与低层次focused方法捕获的是互补信号。因此,将两者信号在EmoBoost中融合,可在FakeAVCeleb数据集上提升平均跨操纵泛化AUC 2.1%。
引用
@article{arxiv.2605.19630,
title = {EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection},
author = {Aritra Marik and Marcel Klemt and Anna Rohrbach},
journal= {arXiv preprint arXiv:2605.19630},
year = {2026}
}
备注
Accepted at SAFE@CVPRW 2026