中文

文本推理能否提升 MLLMs 在细粒度视觉分类中的性能?

计算机视觉与模式识别 2026-04-14 v2

摘要

多模态大语言模型(MLLMs)表现出强大的通用能力,但在细粒度视觉分类(FGVC)方面仍表现不佳,这是需要细微视觉区分且对许多实际应用至关重要的核心感知任务。提高此类具有挑战性任务(如数学和编程)性能的常用策略是链式思维(CoT)推理。然而,已有研究报告称CoT实际上会损害视觉感知任务的性能。这些研究虽然从相对狭窄的角度考察问题,却未解释CoT为何会损害感知型性能。我们通过零样本评估和多种训练范式系统地重审CoT在FGVC中的作用。我们发现,CoT导致的性能下降主要由推理长度驱动,较长的文本推理持续降低分类准确率。我们称之为“思考成本”。基于这一发现,我们做出了两个关键贡献:(1) MRN,即一种用于多奖励优化的简单且通用的插即插归一化方法,可平衡异构奖励信号;(2) ReFine-RFT,一种结合集成奖励与MRN的框架,用于约束推理长度并提供稠密准确性反馈。广泛的实验表明,我们的发现和提出的ReFine-RFT在FGVC基准测试中实现了最先进的性能。项目页面:https://refine-rft.github.io/。

关键词

引用

@article{arxiv.2601.06993,
  title  = {Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?},
  author = {Jie Zhu and Yiyang Su and Xiaoming Liu},
  journal= {arXiv preprint arXiv:2601.06993},
  year   = {2026}
}

备注

CVPR Finding, 2026