从重构误差中矿掘伪造痕迹:面向多模态深度伪造的时间局部化的弱监督框架
计算机视觉与模式识别
2026-05-19 v2
摘要
现代深度伪造已演变为具有局部性和间歇性的操纵,要求进行细粒度的时间局部化以缓解严重的数字安全风险。帧级标注成本高昂,使得弱监督方法成为实际必要,这些方法仅依赖视频级别标签。为此,我们提出了基于重构的深度伪造时间局部化框架(RT-DeepLoc),通过重构误差识别伪造信息。我们的框架使用在真实数据上训练的掩码自编码器(MAE),以学习其内在的时空模式;这允许模型为伪造片段产生显著的重构差异,有效地为准确的局部化提供所需的细粒度线索,而无需密集的人类标注。在稳健地利用这些指示方面,我们引入了一种新颖的非对称视频内对比损失(AICL)。通过聚焦于这些重构线索所引导的真实特征的紧凑性,AICL 建立了一个稳定的决策边界,以增强局部判别力,同时通过先进的生成模型保持对未见伪造的泛化。大规模数据集(包括 LAV-DF)上的广泛实验表明,RT-DeepLoc 在弱监督时间深度伪造局部化方面实现了最先进的性能。
引用
@article{arxiv.2601.21458,
title = {Mining Forgery Traces from Reconstruction Error: A Weakly Supervised Framework for Multimodal Deepfake Temporal Localization},
author = {Midou Guo and Qilin Yin and Wei Lu and Rui Yang},
journal= {arXiv preprint arXiv:2601.21458},
year = {2026}
}