在 LLM 中利用类比文本描述进行视觉语言导航
人工智能
2025-09-30 v1 计算机视觉与模式识别
多媒体
摘要
将大语言模型(LLM)集成到具身 AI 模型中正变得日益普遍。然而,现有的基于零样本 LLM 的视觉语言导航(VLN)智能体要么将图像编码为文本场景描述(这可能过度简化视觉细节),要么处理原始图像输入(这可能无法捕捉高级推理所需的抽象语义)。在本文中,我们通过引入多视角的文本描述来促进跨图像的类比推理,从而改进导航智能体的上下文理解。通过利用基于文本的类比推理,智能体增强了其全局场景理解和空间推理能力,从而做出更准确的动作决策。我们在 R2R 数据集上评估了该方法,实验表明导航性能有显著提升。
引用
@article{arxiv.2509.25139,
title = {Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs},
author = {Yue Zhang and Tianyi Ma and Zun Wang and Yanyuan Qiao and Parisa Kordjamshidi},
journal= {arXiv preprint arXiv:2509.25139},
year = {2025}
}