基于动作-场景-对象模块化的 NavComposer:用于构建导航轨迹语言指令
人工智能
2025-08-11 v1 计算与语言
计算机视觉与模式识别
摘要
语言引导的导航是具身人工智能中的核心任务,使代理能够解释语言指令并导航至复杂环境。然而,专家提供的指令数量有限,而合成注释往往质量不足,导致其在大规模研究中不足。为此,我们提出NavComposer,一种自动生成高质量导航指令的新框架。NavComposer 明确分解诸如动作、场景和对象等语义实体,并将其重新组合成自然语言指令。其模块化架构允许灵活集成最新技术,显式使用语义实体可提升指令的丰富性和准确性。此外,它以数据中立方式运行,支持适用于各种导航轨迹的适应,无需特定领域训练。辅以NavComposer,我们引入NavInstrCritic,一个综合性无注释评估系统,围绕对比匹配、语义一致性和语言多样性三个维度评估导航指令。NavInstrCritic 提供对指令质量的整体评估,弥补了依赖大量专家注释的传统度量的局限性。通过将指令生成和评估从特定导航代理中解耦,我们的方法实现了更可扩展和更通用的研究。大量实验直接且实用的证明了我们方法的有效性。
引用
@article{arxiv.2507.10894,
title = {NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization},
author = {Zongtao He and Liuyi Wang and Lu Chen and Chengju Liu and Qijun Chen},
journal= {arXiv preprint arXiv:2507.10894},
year = {2025}
}