DREAMWALKER:面向连续视觉-语言导航的心理规划
计算机视觉与模式识别
2023-08-16 v1 人工智能
摘要
VLN-CE 是近期发布的具身任务,其中 AI 智能体需在自由可遍历环境中导航至远处目标位置,并给定语言指令。由于可能策略空间巨大,该任务带来极大挑战。基于对未来动作后果进行预判的能力对智能且可解释规划行为的涌现至关重要的信念,我们提出 DREAMWALKER——一种基于世界模型的 VLN-CE 智能体。该世界模型将复杂连续环境的视觉、拓扑与动态属性总结为离散、结构化且紧凑的表示。DREAMWALKER 可在执行高代价动作前,于此类内部抽象世界中完全模拟并评估可能计划。与现有无模型 VLN-CE 智能体仅在真实世界中做贪婪决策(易导致短视行为)不同,DREAMWALKER 能够通过大量“心理实验”进行策略规划。此外,想象出的未来场景反映了智能体的意图,使其决策过程更透明。在 VLN-CE 数据集上的大量实验与消融研究证实了所提方法的有效性,并指明了有价值的未来方向。
引用
@article{arxiv.2308.07498,
title = {DREAMWALKER: Mental Planning for Continuous Vision-Language Navigation},
author = {Hanqing Wang and Wei Liang and Luc Van Gool and Wenguan Wang},
journal= {arXiv preprint arXiv:2308.07498},
year = {2023}
}
备注
Accepted at ICCV 2023; Project page: https://github.com/hanqingwangai/Dreamwalker