Fake-HR1:重新思考合成图像检测中视觉语言模型的推理
计算机视觉与模式识别
2026-04-14 v3 人工智能
摘要
最近的研究表明,将链式思考(CoT)推理融入检测过程可增强模型识别合成图像的能力。然而,过于冗长的推理会产生显著的资源开销,包括token消耗和延迟,在处理明显生成的伪造图像时尤为冗余。为此,我们提出Fake-HR1——一个大规模混合推理模型,我们的工作是在已知条件下,首次自适应地确定基于生成检测任务特征是否需要推理。为实现此目标,我们设计了两个阶段的训练框架:首先进行混合微调(HFT)进行冷启动初始化,随后通过混合推理分组策略优化(HGRPO)进行在线强化学习,以隐式学习何时选择合适的推理模式。实验结果表明,Fake-HR1在不同类型的查询中自适应地执行推理,超越了现有的大语言模型,在推理能力和生成图像检测性能方面均表现出色,同时显著提高了响应效率。
引用
@article{arxiv.2602.10042,
title = {Fake-HR1: Rethinking Reasoning of Vision Language Model for Synthetic Image Detection},
author = {Changjiang Jiang and Xinkuan Sha and Fengchang Yu and Jingjing Liu and Jian Liu and Mingqi Fang and Chenfeng Zhang and Wei Lu},
journal= {arXiv preprint arXiv:2602.10042},
year = {2026}
}
备注
Accepted by ICASSP 2026