中文

Aux-Think:探索数据高效视觉语言导航中的推理策略

机器人学 2025-10-15 v4

摘要

视觉语言导航(VLN)是开发能够跟随自然语言指令在复杂真实环境中导航的具身智能体的关键任务。近期大型预训练模型在 VLN 领域的进展显著提升了泛化能力和指令对齐效果,但在动作导向、长时序的导航任务中,尽管链式思维(Chain-of-Thought, CoT)推理在静态任务(如视觉问答)中取得显著成功,其在导航中的推理策略仍鲜有探索。为填补这一空白,我们首次系统评估了 VLN 中不同推理策略,包括无推理(direct action prediction,简称 No-Think)、行动前推理(Pre-Think)以及行动后推理(Post-Think)。意外发现推理时崩溃(Inference-time Reasoning Collapse)问题,即推理过程会降低导航准确率,凸显将推理机制集成到 VLN 中的挑战。基于此洞见,我们提出 Aux-Think 框架,通过 CoT 监督训练模型内化结构化推理模式,同时在在线预测时直接输出动作,无需显式推理。为支撑该框架,我们首次发布了标注了 Chain-of-Thought 的 VLN 数据集 R2R-CoT-320k。大量实验表明,Aux-Think 在相同数据规模下显著减少训练成本,达到最佳性能。

关键词

引用

@article{arxiv.2505.11886,
  title  = {Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation},
  author = {Shuo Wang and Yongcai Wang and Wanting Li and Xudong Cai and Yucheng Wang and Maiyue Chen and Kaihui Wang and Zhizhong Su and Deying Li and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2505.11886},
  year   = {2025}
}