中文

TIGeR:工具集成几何推理在视觉语言模型中用于机器人

机器人学 2026-03-05 v3 人工智能 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)已在空间推理方面展现出惊人的能力,但它们在本质上受限于定性精度,缺乏满足实际机器人应用所需的计算精度。当前方法未能利用深度传感器和相机标定中的度量线索,反而将几何问题简化为模式识别任务,无法提供机器人操作所必需的厘米级精度。我们提出了 TIGeR(Tool-Integrated Geometric Reasoning),一种新型框架,通过外部工具生成并执行精确的几何计算,将 VLMs 从感知估计器转化为几何计算机。不尝试在神经网络内部内化复杂的几何运算,而是使模型识别几何推理需求,合成适当的计算代码,并调用专用库进行精确计算。为支持这一范式,我们引入了 TIGeR-300K,一个涵盖点变换、姿态估计和空间兼容性验证的工具调用导向数据集,包含工具调用序列和中间计算。通过结合监督微调(SFT)和强化微调(RFT)的两阶段训练流程,采用我们提出的分层奖励设计,TIGeR 在几何推理基准测试中实现最先进性能,并在实际机器人操作中实现厘米级精度。

关键词

引用

@article{arxiv.2510.07181,
  title  = {TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics},
  author = {Yi Han and Enshen Zhou and Shanyu Rong and Jingkun An and Pengwei Wang and Zhongyuan Wang and Cheng Chi and Lu Sheng and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2510.07181},
  year   = {2026}
}

备注

8 pages, 6 figures