Pathdreamer:一种用于室内导航的世界模型
计算机视觉与模式识别
2021-08-18 v2 机器学习
摘要
人们在陌生建筑中导航时,会利用大量视觉、空间和语义线索来高效实现导航目标。为使计算智能体具备类似能力,我们引入了 Pathdreamer,一种用于在新颖室内环境中导航的视觉世界模型。给定一个或多个先前的视觉观测,Pathdreamer 为训练时未见过建筑中未访问视点生成合理的高分辨率360度视觉观测(RGB、语义分割和深度)。在高不确定性区域(例如拐角处预测、想象未见房间的内容),Pathdreamer 可预测多样场景,使智能体能对给定轨迹采样多个真实结果。我们通过在下游视觉与语言导航(VLN)任务中使用 Pathdreamer,证明其编码了关于人类环境的有用且可获取的视觉、空间和语义知识。具体而言,我们展示使用 Pathdreamer 提前规划带来了约相当于在实际环境未观测部分观测上前瞻一半的收益。我们希望 Pathdreamer 能帮助解锁基于模型的方法以应对具身导航挑战性任务,如导航至指定物体和 VLN。
引用
@article{arxiv.2105.08756,
title = {Pathdreamer: A World Model for Indoor Navigation},
author = {Jing Yu Koh and Honglak Lee and Yinfei Yang and Jason Baldridge and Peter Anderson},
journal= {arXiv preprint arXiv:2105.08756},
year = {2021}
}
备注
In ICCV 2021