基于大语言模型的面向连续环境视觉语言导航的生成式智能体 Cog-GA
人工智能
2024-09-24 v2 机器人学
摘要
视觉语言导航连续环境 (VLN-CE) 代表了具身人工智能的一个前沿领域,要求智能体仅凭自然语言指令在无限的 3D 空间中自由导航。该任务在多模态理解、空间推理和决策方面带来了独特的挑战。为此,我们引入 Cog-GA,一个基于大语言模型 (LLM) 的生成式智能体,专为 VLN-CE 任务而设计。Cog-GA 采用双重策略来模拟人类的认知过程。首先,它构建认知地图,将时空语义元素融合,从而促进 LLM 中空间记忆的发展。其次,Cog-GA 采用预测路标机制,战略性地优化探索轨迹以最大化导航效率。每个路标都伴随双通道场景描述,将环境线索划分为“是什么”和“哪里”两个流,增强智能体的注意力聚焦,使其能够辨别导航所必需的相关空间信息。反思机制补充了这些策略,通过捕捉先前导航经验的反馈,实现持续学习和自适应重规划。对 VLN-CE 基准的广泛评估表明,Cog-GA 实现了领先的性能,并能够模拟人类式的导航行为。该研究显著推动了开发具备战略性和可解释性的 VLN-CE 智能体。
引用
@article{arxiv.2409.02522,
title = {Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments},
author = {Zhiyuan Li and Yanfeng Lu and Yao Mu and Hong Qiao},
journal= {arXiv preprint arXiv:2409.02522},
year = {2024}
}