分层思考,动态行动:面向视觉语言导航的分层多模态融合与推理
计算机视觉与模式识别
2025-04-28 v2 人工智能
摘要
视觉语言导航旨在使具身智能体能够遵循自然语言指令并在真实环境中到达目标位置。先前方法通常依赖全局场景表示或物体级特征,但这些方法不足以捕捉跨模态的复杂交互,而精确导航需要这些交互。本文提出了一种多级融合与推理架构(MFRA),以增强智能体对视觉观察、语言指令和导航历史的推理能力。具体而言,MFRA引入了一种分层融合机制,聚合跨多个模态的多级特征——从低级视觉线索到高级语义概念。我们进一步设计了一个推理模块,利用融合表示通过指令引导注意力和动态上下文集成来推断导航动作。通过选择性捕获和组合相关的视觉、语言和时间信号,MFRA提高了复杂导航场景中的决策准确性。在包括REVERIE、R2R和SOON在内的基准VLN数据集上的大量实验表明,MFRA相比最先进方法取得了优越性能,验证了多级模态融合在具身导航中的有效性。
引用
@article{arxiv.2504.16516,
title = {Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation},
author = {Junrong Yue and Yifan Zhang and Chuan Qin and Bo Li and Xiaomin Lie and Xinlei Yu and Wenxin Zhang and Zhendong Zhao},
journal= {arXiv preprint arXiv:2504.16516},
year = {2025}
}
备注
11 pages, 4 figures, Submitted to ACM MM 2025