语言条件下的世界建模用于视觉导航
计算机视觉与模式识别
2026-03-31 v1 人工智能
机器人学
摘要
我们研究语言条件下的视觉导航 (LCVN),即由一个具身智能体根据仅基于初始三维视角观察的自然语言指令来执行导航任务。由于无法访问目标图像,智能体必须依赖语言来塑造其感知和连续控制,这一问题在实际应用中尤为具有挑战性。我们将该问题形式化为在语言指令条件下进行的开环轨迹预测,并引入 LCVN 数据集,这是一个包含 39,016 条轨迹和 117,048 条人工验证指令的基准,支持在多种环境和指令风格下可重复的研究。使用该数据集,我们开发了 LCVN 框架,将语言 grounding、未来状态预测和动作生成通过两种互补的模型家族链接起来。第一种家族将 LCVN-WM(一种基于扩散的世界模型)与 LCVN-AC(在世界模型的潜在空间中训练的演员-评论家智能体)结合。第二种家族,LCVN-Uni,采用自回归多模态架构,同时预测动作和未来观察。实验表明,这两种方法各有优势:前者提供更具时序一致性的 rollout,后者在面对未见环境时表现出更好的泛化能力。综合这些观察结果,指向在统一任务设置中共同研究语言 grounding、想象和策略学习的价值,LCVN 为进一步探索语言条件下的世界模型提供了具体基础。代码已公开于 https://github.com/F1y1113/LCVN。
引用
@article{arxiv.2603.26741,
title = {Language-Conditioned World Modeling for Visual Navigation},
author = {Yifei Dong and Fengyi Wu and Yilong Dai and Lingdong Kong and Guangyu Chen and Xu Zhu and Qiyu Hu and Tianyu Wang and Johnalbert Garnica and Feng Liu and Siyu Huang and Qi Dai and Zhi-Qi Cheng},
journal= {arXiv preprint arXiv:2603.26741},
year = {2026}
}
备注
19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN