中文

基于事件知识图谱增强的粗粒度视觉语言导航任务规划

信息检索 2024-08-06 v1 人机交互 机器人学

摘要

视觉语言导航 (VLN) 是具身人工智能中的重要研究方向,旨在使智能体理解周围环境并完成导航任务。VLN指令可分为粗粒度与细粒度两类。细粒度指令以子任务步骤形式完整描述整个任务,而粗粒度指令则给出抽象的任务描述,更符合人类的习惯。目前大多数研究聚焦于前者,忽略了属于日常场景的后者。为克服此挑战,本文尝试通过事件知识增强来处理粗粒度指令。具体而言,我们提出了基于提示的框架,用于从多个主流基准数据集中整体提取事件知识图谱(称为VLN-EventKG)。通过大模型与小模型协作,实现了基于粗粒度指令输入的知识增强导航规划(称为EventNav)。此外,我们设计了一种新型的动态历史回溯模块,用于实时纠正潜在的错误动作规划。实验结果表明,在各种公开基准数据集上,我们的方法在使用VLN-EventKG处理粗粒度指令时优势显著,成功率提升超过5%。我们的项目已公开,地址为 https://sites.google.com/view/vln-eventkg

关键词

引用

@article{arxiv.2408.02535,
  title  = {Towards Coarse-grained Visual Language Navigation Task Planning Enhanced by Event Knowledge Graph},
  author = {Zhao Kaichen and Song Yaoxian and Zhao Haiquan and Liu Haoyu and Li Tiefeng and Li Zhixu},
  journal= {arXiv preprint arXiv:2408.02535},
  year   = {2024}
}

备注

11 pages, 6 figures