中文

ReAlign:通过推理对齐表示实现可泛化的图像伪造检测

计算机视觉与模式识别 2026-05-18 v1

摘要

AI生成图像(AIGIs)的兴起对数字真实性构成了日益严峻的挑战,催生了对高效、可泛化的图像伪造检测系统的需求。现有方法,无论是基于非大语言模型(non-LLM)还是基于大语言模型(LLM),都展现出独特的优势与局限。基于非LLM的模型能高效检测低级伪影,但往往缺乏语义理解。相反,基于LLM的方法提供了强大的语义推理和可解释性,但计算密集且对细微视觉伪影不够敏感。此外,解释性推理文本对伪造检测性能的真实贡献仍不明确。在本工作中,我们探究了LLM生成推理文本的内在价值与潜力,将其视为泛化能力和语义错误敏感性的来源。基于这些发现,我们提出了ReAlign,一个新颖的框架,通过对比学习将由GRPO优化的LLM生成的高质量推理文本蒸馏到一个轻量级的AIGI检测器中。ReAlign有效地继承了推理文本表示的泛化能力和语义敏感性,同时保持了部署的高效与轻量。此外,ReAlign采用了一种定制的联合优化策略,整合了用于图像-文本对齐的对比损失和用于精确伪造判别的分类损失。在AIGCDetectBenchmark、AIGI-Holmes以及我们新构建的UltraSynth-10k上的实验结果表明,ReAlign在准确性和泛化能力上持续优于现有的最先进检测器,尤其是在面对来自现代生成模型的复杂、高保真伪造时。

关键词

引用

@article{arxiv.2605.16080,
  title  = {ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation},
  author = {Qing Huang and Zhipei Xu and Xuanyu Zhang and Xiangyu Yu and Jian Zhang},
  journal= {arXiv preprint arXiv:2605.16080},
  year   = {2026}
}

备注

Accepted by CVPR 2026