NavRAG:通过检索增强的大语言模型生成用户需求指令以实现本体化导航
人工智能
2025-03-10 v3 计算与语言
计算机视觉与模式识别
摘要
视觉语言导航(VLN)是具身智能体的关键技能,使其能够在三维环境中Following 自然语言指令进行导航。高性能导航模型需要大量训练数据,手动标注数据的高成本严重阻碍了该领域的发展。因此,一些先前的方法将轨迹视频翻译为分步指令以扩充数据,但此类指令与用户沟通方式不符,用户通常简要描述目的地或明确说明具体需求。此外,局部导航轨迹忽略了全局上下文和高层次任务规划。为解决这些问题,我们提出了NavRAG——一个检索增强生成(RAG)框架,用于为VLN生成用户需求指令。NavRAG利用大语言模型构建分层场景描述树,以实现从全局布局到局部细节的三维场景理解,然后模拟各种具有特定需求的用户角色,从场景树中检索信息,生成多样化的指令。我们横跨861个场景标注了超过200万条导航指令,并评估了训练模型的数据质量和导航性能。
引用
@article{arxiv.2502.11142,
title = {NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM},
author = {Zihan Wang and Yaohui Zhu and Gim Hee Lee and Yachun Fan},
journal= {arXiv preprint arXiv:2502.11142},
year = {2025}
}