中文

面向技能感知视觉语言模型的反事实交互式导航-CoINS

机器人学 2026-01-08 v1

摘要

最近的视觉语言模型(VLM)在机器人规划方面展现出巨大的潜力。然而,这些模型通常功能于语义推理者,缺乏对特定机器人物理能力的内在理解。这一限制在交互式导航中尤为关键,因为机器人必须主动修改混乱的环境以创建可遍历的路径。现有的VLM-based导航器主要局限于被动障碍规避,无法就何时如何与物体交互以清除阻塞路径进行推理。为弥合这一差距,我们提出了通过技能感知VLM的反事实交互式导航(CoINS),一种层次化框架,集成技能感知推理与稳健的低层执行。具体而言,我们微调了一个VLM模型InterNav-VLM,该模型将技能 affordance 和具体约束参数整合到输入上下文中,并将其映射到度量尺度的环境表示中。通过在提出的InterNav数据集上进行微调,模型内部化了反事实推理逻辑,学习了隐式评估物体移除对导航连通性的因果效应,从而确定交互必要性和目标选择。为执行生成的高层计划,我们通过强化学习开发了综合性技能库,特别引入以可遍历性为导向的策略,以操作多样化的物体以清除路径。我们提出了一个在Isaac Sim中系统化的基准,用于评估交互式导航的推理与执行方面。大量仿真和实际实验表明,CoINS显著优于代表性基线,整体成功率提高了17%,在复杂长程场景中相对于最佳基线实现了80%以上的改进。

关键词

引用

@article{arxiv.2601.03956,
  title  = {CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM},
  author = {Kangjie Zhou and Zhejia Wen and Zhiyong Zhuo and Zike Yan and Pengying Wu and Ieng Hou U and Shuaiyang Li and Han Gao and Kang Ding and Wenhan Cao and Wei Pan and Chang Liu},
  journal= {arXiv preprint arXiv:2601.03956},
  year   = {2026}
}

备注

17 pages, 13 figures