深度伪造足够逼真吗?探索语义不匹配这一新挑战
计算机视觉与模式识别
2026-05-01 v1
摘要
当前的深度伪造检测场景大多是二元的,然而数据操作可能跨越音频、视频或两者,其变异性在二元设定中并未被捕捉。四类音视频公式通过区分操作类型来解决这个问题,但引入了一个未解决的问题:模型可能仅依赖数据源完整性来检测深度伪造,而不评估其语义一致性。如果深度伪造的来源不在数据源中,而在其内容中,那么最先进的方法能否评估语义不匹配?本文提出了一种新的评估设置,通过显式建模真实模态之间的语义级不一致性,并引入一个新类别:具有语义不匹配的真实音频-真实视频 (RARV-SMM),扩展了四类公式。我们使用 FakeAVCeleb 数据集评估了最先进模型在这种新的现实深度伪造设定中的鲁棒性,突显了现有方法在面对语义不匹配数据时的局限性。我们进一步引入了三种 RARV-SMM 变体,这些变体暴露了随着音视频差异增大而出现的不同架构脆弱性。我们还提出了一种语义增强策略,该策略结合了语义不匹配类别和 ImageBind 嵌入,以在我们提出的设定和最先进的设定中改进深度伪造检测,在 FakeAVCeleb 和 LAV-DF 上,为更逼真的深度伪造检测器铺平了道路。源代码和数据可在 https://github.com/ 获取。
引用
@article{arxiv.2604.28022,
title = {Are DeepFakes Realistic Enough? Exploring Semantic Mismatch as a Novel Challenge},
author = {Sharayu Nilesh Deshmukh and Kailash A. Hambarde and Joana C. Costa and Hugo Proença and Tiago Roxo},
journal= {arXiv preprint arXiv:2604.28022},
year = {2026}
}
备注
Submitted to IJCB 2026