基于事件知识图谱增强的粗粒度视觉语言导航任务规划
信息检索
2024-08-06 v1 人机交互
机器人学
摘要
视觉语言导航 (VLN) 是具身人工智能中的重要研究方向,旨在使智能体理解周围环境并完成导航任务。VLN指令可分为粗粒度与细粒度两类。细粒度指令以子任务步骤形式完整描述整个任务,而粗粒度指令则给出抽象的任务描述,更符合人类的习惯。目前大多数研究聚焦于前者,忽略了属于日常场景的后者。为克服此挑战,本文尝试通过事件知识增强来处理粗粒度指令。具体而言,我们提出了基于提示的框架,用于从多个主流基准数据集中整体提取事件知识图谱(称为VLN-EventKG)。通过大模型与小模型协作,实现了基于粗粒度指令输入的知识增强导航规划(称为EventNav)。此外,我们设计了一种新型的动态历史回溯模块,用于实时纠正潜在的错误动作规划。实验结果表明,在各种公开基准数据集上,我们的方法在使用VLN-EventKG处理粗粒度指令时优势显著,成功率提升超过5%。我们的项目已公开,地址为 https://sites.google.com/view/vln-eventkg
引用
@article{arxiv.2408.02535,
title = {Towards Coarse-grained Visual Language Navigation Task Planning Enhanced by Event Knowledge Graph},
author = {Zhao Kaichen and Song Yaoxian and Zhao Haiquan and Liu Haoyu and Li Tiefeng and Li Zhixu},
journal= {arXiv preprint arXiv:2408.02535},
year = {2024}
}
备注
11 pages, 6 figures