中文

TaxonRL:基于中间奖励的可解释细粒度视觉推理强化学习

计算机视觉与模式识别 2026-03-05 v1 计算与语言

摘要

传统视觉语言模型在区分同一属或科中视觉相似的物种方面难以实现对比性细粒度分类推理。我们引入 TaxonRL,一种利用带中间奖励的群体相对策略优化(Group Relative Policy Optimization)方法的强化学习方法,将推理过程分解为层次化分类预测。该方法激励模型在作出最终分类之前,显式地对物种级、属级和科级特征进行推理。这种结构化方法不仅旨在提升准确率,还旨在产生透明、可验证的决策过程。在具有挑战性的 Birds-to-Words 数据集上,TaxonRL 实现了 91.7% 的平均准确率,超越人类水平(77.3%),同时生成可解释的推理痕迹。我们展示了强大的跨域泛化能力,物种和海洋动物验证中均取得显著提升。我们的结果表明,强制实施结构化、层次化推理为细粒度视觉判别提供了强大且可迁移的框架。

关键词

引用

@article{arxiv.2603.04380,
  title  = {TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning},
  author = {Maximilian von Klinski and Maximilian Schall},
  journal= {arXiv preprint arXiv:2603.04380},
  year   = {2026}
}

备注

Accepted at WACV 2026