面向视觉语言导航的目标驱动结构化 Transformer 规划器
计算机视觉与模式识别
2022-07-25 v1 人工智能
计算与语言
机器学习
摘要
视觉语言导航是指引具身智能体依据自然语言指令在 3D 场景中导航的任务。对智能体而言,从视觉-语言线索推断长期导航目标对可靠路径规划至关重要,然而此前文献中鲜有研究。本文提出一种目标驱动结构化 Transformer 规划器(TD-STP),用于长程目标引导且感知房间布局的导航。具体而言,我们设计一种想象场景分词机制,用于显式估计长期目标(即便位于未探索环境中)。此外,我们设计结构化 Transformer 规划器,将已探索房间布局优雅地融入神经注意力架构以实现结构化全局规划。实验结果表明,在 R2R 与 REVERIE 基准的测试集上,我们的 TD-STP 分别将此前最佳方法的成功率提升了 2% 与 5%。代码见 https://github.com/YushengZhao/TD-STP。
引用
@article{arxiv.2207.11201,
title = {Target-Driven Structured Transformer Planner for Vision-Language Navigation},
author = {Yusheng Zhao and Jinyu Chen and Chen Gao and Wenguan Wang and Lirong Yang and Haibing Ren and Huaxia Xia and Si Liu},
journal= {arXiv preprint arXiv:2207.11201},
year = {2022}
}