中文

使视觉语言模型更适用于机器人:自关键蒸馏低层次程序推理

机器人学 2025-07-22 v2

摘要

大语言模型(LLM)在机器人程序规划方面显示出巨大的潜力,但其以人类为中心的推理往往忽略了机器人执行所需的底层、具体化细节。视觉语言模型(VLM)为实现更感知性 grounding 的计划提供了路径,但当前方法要么依赖昂贵的大规模模型,要么受限于狭窄的仿真环境。我们引入SelfReVision,一个轻量且可扩展的视觉语言程序规划自我改进框架。SelfReVision 使小型VLM能够在无需外部监督或教师模型的情况下,迭代地对自身计划进行批判、修订和验证——灵感来自链式思考提示和自指令范式。通过该自我蒸馏循环,模型生成更高质量、可直接执行的计划,可用于推理以及持续微调。我们使用从 3B 到 72B 的模型,结果表明SelfReVision不仅提升了弱基线VLM的性能,还能超越规模为 100 倍的模型,实现下游具身任务的改进控制。

关键词

引用

@article{arxiv.2507.08224,
  title  = {Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning},
  author = {Chan Young Park and Jillian Fisher and Marius Memmel and Dipika Khullar and Seoho Yun and Abhishek Gupta and Yejin Choi},
  journal= {arXiv preprint arXiv:2507.08224},
  year   = {2025}
}

备注

Code Available: https://github.com/chan0park/SelfReVision