基于 MSCT 的深度伪造检测中的差分跨模态注意力
计算机视觉与模式识别
2026-04-10 v1 多媒体
摘要
音视频深度伪造检测通常采用互补多模态模型来检查视频中的伪造痕迹。这些方法主要通过音视频对齐来提取伪造痕迹,而这种对齐源于音频和视频模态之间的不一致。然而,传统的多模态伪造检测方法存在特征提取不足和模态对齐偏差的问题。为此,我们提出了一种用于深度伪造检测的多尺度跨模态变换器编码器(MSCT)。我们的方法包括多尺度自注意力以整合相邻嵌入的特征,以及差分跨模态注意力来融合多模态特征。我们的实验在 FakeAVCeleb 数据集上展示了具有竞争性能,验证了所提出结构的有效性。
引用
@article{arxiv.2604.07741,
title = {MSCT: Differential Cross-Modal Attention for Deepfake Detection},
author = {Fangda Wei and Miao Liu and Yingxue Wang and Jing Wang and Shenghui Zhao and Nan Li},
journal= {arXiv preprint arXiv:2604.07741},
year = {2026}
}
备注
Accpeted by ICASSP2026