KERM:面向视觉与语言导航的知识增强推理模型
计算机视觉与模式识别
2023-03-29 v1
摘要
视觉与语言导航(VLN)是使具身智能体在真实场景中遵循自然语言指令导航至远程位置的任务。以往多数方法利用整体特征或以对象为中心的特征来表示可导航候选。然而,这些表示对于智能体执行动作到达目标位置而言不够高效。由于知识提供了对可见内容起补充作用的关键信息,本文提出一种知识增强推理模型(KERM)以利用知识提升智能体导航能力。具体而言,我们首先基于局部区域从所构建的知识库中检索导航视角的知识事实(即用语言描述表示的知识)。所检索的事实涵盖单个对象的属性(如颜色、形状)到对象间关系(如动作、空间位置),为 VLN 提供关键信息。我们进一步提出 KERM,其包含净化、事实感知交互和指令引导聚合模块,以融合视觉、历史、指令与事实特征。所提出的 KERM 能自动筛选并聚合关键且相关的线索,获得更精确的动作预测。在 REVERIE、R2R 和 SOON 数据集上的实验结果证明了该方法的有效性。
引用
@article{arxiv.2303.15796,
title = {KERM: Knowledge Enhanced Reasoning for Vision-and-Language Navigation},
author = {Xiangyang Li and Zihan Wang and Jiahao Yang and Yaowei Wang and Shuqiang Jiang},
journal= {arXiv preprint arXiv:2303.15796},
year = {2023}
}
备注
Accepted by CVPR 2023. The code is available at https://github.com/XiangyangLi20/KERM