中文

用于视觉-语言导航的强化结构化状态演化方法

计算机视觉与模式识别 2022-05-27 v2

摘要

视觉-语言导航(VLN)任务要求具身智能体遵循自然语言指令导航至远端位置。以往方法通常采用序列模型(如Transformer和LSTM)作为导航器。在此范式中,序列模型通过所维持的导航状态在每一步预测动作,该状态一般表示为一维向量。然而,由于所维持的向量本质上无结构,具身导航任务的关键导航线索(即物体级环境布局)被丢弃。本文中,我们提出一种新颖的结构化状态演化(SEvol)模型,以有效维持VLN的环境布局线索。具体而言,我们利用基于图的特征来表示导航状态,而非基于向量的状态。相应地,我们设计了一种强化布局线索挖掘器(RLM),通过定制的强化学习策略来挖掘并检测对长期导航最关键的布局图。此外,提出结构化演化模块(SEM)以在导航过程中维持基于图的结构化状态,其中状态逐渐演化以学习物体级时空关系。在R2R和R4R数据集上的实验表明,所提SEvol模型大幅提升了VLN模型的性能,例如在R2R测试集上NvEM的绝对SPL精度提升3%,EnvDrop提升8%。

关键词

引用

@article{arxiv.2204.09280,
  title  = {Reinforced Structured State-Evolution for Vision-Language Navigation},
  author = {Jinyu Chen and Chen Gao and Erli Meng and Qiong Zhang and Si Liu},
  journal= {arXiv preprint arXiv:2204.09280},
  year   = {2022}
}

备注

Accepted to CVPR 2022