将知识图谱与视觉感知对齐以用于物体目标导航
计算机视觉与模式识别
2024-04-29 v2 机器人学
摘要
物体目标导航是一项具有挑战性的任务,需要根据第一人称视觉观察引导代理到达特定物体。代理理解周围环境的能力对于成功找到物体至关重要。然而,现有的基于知识图谱的导航器通常依赖离散的分类独热向量和投票计数策略来构建场景的图表示,这导致与视觉图像不对齐。为了提供更准确和连贯的场景描述并解决这一不对齐问题,我们提出了用于物体目标导航的“将知识图谱与视觉感知对齐”(AKGVP)方法。技术上,我们的方法引入了分层场景架构的连续建模,并利用视觉 - 语言预训练将自然语言描述与视觉感知对齐。连续知识图谱架构与多模态特征对齐的整合赋予了导航器卓越的零样本导航能力。我们使用 AI2-THOR 模拟器广泛评估了我们的方法,并进行了一系列实验以证明我们导航器的有效性和效率。代码地址:https://github.com/nuoxu/AKGVP。
引用
@article{arxiv.2402.18892,
title = {Aligning Knowledge Graph with Visual Perception for Object-goal Navigation},
author = {Nuo Xu and Wen Wang and Rong Yang and Mengjie Qin and Zheyuan Lin and Wei Song and Chunlong Zhang and Jason Gu and Chao Li},
journal= {arXiv preprint arXiv:2402.18892},
year = {2024}
}
备注
Accepted to ICRA 2024