VL-LN基准:面向长时程目标导向导航的主动对话
机器人学
2026-01-26 v4
摘要
在大多数现有的具身导航任务中,指令是明确且无歧义的,例如指令跟随和物体搜索。在这种理想化设定下,智能体仅需根据视觉和语言输入产生有效的导航输出。然而,现实世界的导航指令往往模糊且含混,要求智能体通过主动对话来解决不确定性并推断用户意图。为弥补这一差距,我们提出了交互式实例目标导航(IIGN)任务,该任务要求智能体不仅生成导航动作,还要通过主动对话产生语言输出,从而更贴近实际应用场景。IIGN扩展了实例目标导航(IGN),允许智能体在导航过程中以自然语言自由咨询一个“先知”。基于此任务,我们提出了视觉语言-语言导航(VL-LN)基准,它提供了一个大规模自动生成的数据集和一套全面的评估协议,用于训练和评估具备对话能力的导航模型。VL-LN包含超过4.1万条长时程对话增强轨迹用于训练,以及一个包含能响应智能体查询的“先知”的自动评估协议。利用该基准,我们训练了一个具备对话能力的导航模型,并证明其相较于基线方法取得了显著改进。大量实验和分析进一步证明了VL-LN在推动对话式具身导航研究方面的有效性和可靠性。代码和数据集:https://0309hws.github.io/VL-LN.github.io/
引用
@article{arxiv.2512.22342,
title = {VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs},
author = {Wensi Huang and Shaohao Zhu and Meng Wei and Jinming Xu and Xihui Liu and Hanqing Wang and Tai Wang and Feng Zhao and Jiangmiao Pang},
journal= {arXiv preprint arXiv:2512.22342},
year = {2026}
}