中文

超越语义先验:面向通用视觉 Forensics 的优化坍塌缓解

计算机视觉与模式识别 2026-03-26 v1

摘要

虽然视觉语言模型 (VLM) 如 CLIP 作为通用深度伪造检测的主导范式不断出现,但仍存在表示性间隔:其语义中心预训练不适用于捕捉超现实合成中固有的非语义性迹象。在本工作中,我们识别了一种称为优化坍塌的失效模式,即使用锐度感知最小化 (SAM) 训练的检测器在扰动半径超过狭窄阈值后,会退化为对非语义伪造进行随机猜测。为理论形式化此类坍塌,我们提出了关键优化半径 (COR) 以量化优化 landscape 的几何稳定性,利用梯度信噪比 (GSNR) 测量泛化潜力。我们证明 COR 随着 GSNR 单调递增,从而揭示 SAM 优化的几何不稳定性源于内在泛化潜力的退化。该结果识别了 GSNR 逐层衰减作为检测非语义伪造时优化坍塌的根本原因。虽然降低扰动半径可在 SAM 下实现稳定收敛,但仅治疗症状而未缓解内在泛化退化,因而需要增强梯度保真度。基于此洞察,我们提出了对比性区域注入变换器 (CoRIT),其整合了计算高效的对比梯度代理 (CGP) 及三种无训练策略:区域细化掩码抑制 CGP 方差、区域信号注入保持 CGP 幅值、层次表示集成以实现更通用性表示。大量实验表明,CoRIT 缓解了优化坍塌,在跨域和通用伪造基准中实现了最新的泛化性能。

关键词

引用

@article{arxiv.2603.24057,
  title  = {Beyond Semantic Priors: Mitigating Optimization Collapse for Generalizable Visual Forensics},
  author = {Jipeng Liu and Haichao Shi and Siyu Xing and Rong Yin and Xiao-Yu Zhang},
  journal= {arXiv preprint arXiv:2603.24057},
  year   = {2026}
}