中文

增强常识知识用于远程目标定位

计算机视觉与模式识别 2024-06-04 v1 人工智能

摘要

视觉与语言导航(VLN)任务要求智能体感知周围环境、遵循自然语言指令并在逼真的未见环境中行动。大多数现有方法使用整个图像或物体特征来表示可导航视点。然而,这些表示不足以进行正确的动作预测,特别是对于REVERIE任务,该任务使用简洁的高级指令,例如“把主卧室里的蓝色靠垫拿给我”。为了解决表示增强问题,我们提出了一种增强常识知识模型(ACK),利用常识信息作为时空知识图来改善智能体导航。具体而言,所提出的方法包括通过从ConceptNet检索常识信息来构建知识库,然后使用一个精炼模块去除噪声和无关知识。我们进一步提出了ACK,它包含知识图谱感知的跨模态和概念聚合模块,通过整合可见物体、常识知识和包含物体与知识时序信息的概念历史来增强视觉表示和视觉-文本数据对齐。此外,我们为基于常识的决策过程添加了一个新流程,从而实现了更准确的局部动作预测。实验结果表明,我们提出的模型显著优于基线,并在REVERIE基准上达到了最先进水平。

关键词

引用

@article{arxiv.2406.01256,
  title  = {Augmented Commonsense Knowledge for Remote Object Grounding},
  author = {Bahram Mohammadi and Yicong Hong and Yuankai Qi and Qi Wu and Shirui Pan and Javen Qinfeng Shi},
  journal= {arXiv preprint arXiv:2406.01256},
  year   = {2024}
}