RxR-Habitat 视觉与语言导航竞赛(CVPR 2022)冠军方案
计算机视觉与模式识别
2022-06-28 v2 人工智能
机器人学
摘要
本报告介绍了 CVPR 2022 中 RxR-Habitat 竞赛获奖方案的方法。该竞赛解决了连续环境中的视觉与语言导航(VLN-CE)问题,要求智能体逐步遵循自然语言指令到达目标。我们提出了一种用于该任务的模块化规划与控制方法。我们的模型由三个模块组成:候选航点预测器(CWP)、历史增强规划器以及试错控制器。在每个决策循环中,CWP 首先基于多视角深度观测预测一组候选航点,这能降低动作空间的复杂度并便于规划。随后,采用历史增强规划器从候选航点中选择一个作为子目标。该规划器额外编码历史记忆以跟踪导航进度,这对长程导航尤为有效。最后,我们提出一种名为试错(tryout)的非参数启发式控制器来执行底层动作以到达规划出的子目标。它基于试错机制,可帮助智能体避开障碍物并摆脱卡死。三个模块分层协作直至智能体停止。我们进一步采用视觉与语言导航(VLN)的若干近期进展来提升性能,例如基于大规模合成同域数据集的预训练、环境级数据增强以及快照模型集成。我们的模型赢得了 RxR-Habitat 竞赛 2022,在 NDTW 和 SR 指标上相对现有方法分别取得了 48% 和 90% 的提升。
引用
@article{arxiv.2206.11610,
title = {1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)},
author = {Dong An and Zun Wang and Yangguang Li and Yi Wang and Yicong Hong and Yan Huang and Liang Wang and Jing Shao},
journal= {arXiv preprint arXiv:2206.11610},
year = {2022}
}
备注
Winner of the 2nd RxR-Habitat Competition @ CVPR2022