面向连续坐标的数值视觉链律思考
计算机视觉与模式识别
2026-03-02 v1
摘要
最近的多模态大语言模型(MLLM)越来越依赖视觉链律思考,在图像上执行区域 grounding 推理。然而,现有方法要么通过文本化坐标实现区域 grounding,导致模态不匹配和语义碎片化,要么使用固定粒度的图像块,既限制了精确的区域选择,又常需非平凡的架构修改。本文提出了数值视觉链律思考(Numerical Visual Chain-of-Thought,NV-CoT),一个使 MLLM 能使用连续数值坐标进行图像推理的框架。NV-CoT 将 MLLM 的动作空间从离散词汇标记扩展到连续欧几里得空间,使模型能够直接生成边界框坐标作为动作,只需最小程度的架构修改。该框架支持监督微调和强化学习。具体而言,我们用高斯分布(或拉普拉斯分布)动作代替离散标记策略,并通过重参数化抽样引入随机性,使 NV-CoT 完全兼容 GRPO 风格的策略优化。在三个基准测试上对八个代表性视觉推理基线进行广泛实验,表明 NV-CoT 在局部定位精度和最终答案准确率方面显著提升,同时加速训练收敛,验证了连续动作视觉推理在 MLLM 中的有效性。代码已公开于 https://github.com/kesenzhao/NV-CoT。
引用
@article{arxiv.2602.23959,
title = {Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought},
author = {Kesen Zhao and Beier Zhu and Junbao Zhou and Xingyu Zhu and Zhongqi Yue and Hanwang Zhang},
journal= {arXiv preprint arXiv:2602.23959},
year = {2026}
}