Fine-R1:通过链条推理使多模态大语言模型在细粒度视觉识别中精通
计算机视觉与模式识别
2026-04-28 v3 人工智能
摘要
在视觉世界中,任何实体都可以基于共享特征进行层次化分组,并映射到细粒度子类别中。虽然多模态大语言模型(MLLM)在粗粒度视觉任务中取得了强大的性能,但它们往往在细粒度视觉识别(FGVR)中挣扎。将通用型 MLLM 适应 FGVR 通常需要大量标注数据,而这在获取成本较高,导致其在针对判别性任务专门设计的对比学习 CLIP 模型中存在显著的性能差距。此外,MLLM 往往会对已见子类别过拟合,并对未见子类别的泛化能力较差。为此,我们提出了 Fine-R1,通过一种 R1 风格的训练框架为 FGVR 量身定制的 MLLM:(1)链条推理监督微调,其中我们构建了一个高质量的 FGVR 链条推理数据集,包含“视觉分析、候选子类别、比较和预测”等理由,使模型过渡为一个强大的开放世界分类器;(2)三元组增强策略优化,其中类内增强混合来自锚点图像和正样本图像的轨迹,以提高对类内差异的鲁棒性,而类间增强则最大化跨子类别图像的响应差异,以增强判别能力。仅需 4 -shot 训练,Fine-R1 就能在识别已见和未见子类别方面,超过现有的通用 MLLM、推理 MLLM 乃至对比学习 CLIP 模型,展示了在知识密集型领域的潜力,其中为所有子类别收集专家标注颇具挑战性。代码可在 https://github.com/PKU-ICST-MIPL/FineR1_ICLR2026 查看。
引用
@article{arxiv.2602.07605,
title = {Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning},
author = {Hulingxiao He and Zijun Geng and Yuxin Peng},
journal= {arXiv preprint arXiv:2602.07605},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1