中文

TikArt:基于强化学习稳定的孔径引导的细粒度视觉推理

计算机视觉与模式识别 2026-03-12 v2 人工智能

摘要

多模态大语言模型 (MLLM) 中的细粒度视觉推理受限于单次全局图像编码:关键证据往往位于小目标、杂乱区域、细微标记或密集图表中。我们提出了 \textbf{TikArt} (\textbf{T}h\textbf{i}n\textbf{k}ing \textbf{A}pe\textbf{rt}ure),一个孔径引导的智能体,将多模态推理形式化为对感兴趣区域的序列证据获取。TikArt 遵循 Think--Aperture--Observe (TAO) 循环,在语言推理与两个孔径动作之间交替:Zoom 提取矩形裁剪,Segment 调用即插即用分割器为不规则目标生成基于掩码的对象中心视图。每次孔径动作后强制进行观察步骤,将局部证据写回文本,产生可解释的孔径轨迹和持久的语言记忆。基于 Qwen3-VL-8B,TikArt 使用基于 GRPO 的强化学习进行训练,采用两阶段课程。为稳定集成工具的长期程学习,我们引入相对不确定性减少 (RUR),一种由冻结评估器计算的稠密奖励,倾向于构建证据轨迹并缓解工具滥用的退化。在高分辨率推理、通用多模态理解以及指代和推理导向的分割任务上均实现了一致的性能提升,表明孔径引导的观察提高了细粒度视觉推理,并自然可迁移到像素级 grounding。

关键词

引用

@article{arxiv.2602.14482,
  title  = {TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning},
  author = {Hao Ding and Zhichuan Yang and Weijie Ge and Ziqin Gao and Chaoyi Lu and Lei Zhao},
  journal= {arXiv preprint arXiv:2602.14482},
  year   = {2026}
}