超越 RGB 的智能体旅程:用于视觉语言导航的层次化语义-空间表示增强
计算机视觉与模式识别
2025-11-14 v5 多媒体
摘要
从自然语言指令在未见环境中导航对于自我中心智能体在视觉语言导航(VLN)中仍然具有挑战性。人类在室内导航时自然地将具体的语义知识锚定在空间布局中。尽管先前工作引入了多种环境表示来改善推理,但辅助模态通常与 RGB 特征简单拼接,未能充分利用每种模态的独特贡献。我们提出了一种层次化的语义理解与空间感知(SUSA)架构,使智能体能够在多个尺度上感知和锚定环境。具体而言,文本语义理解(TSU)模块通过生成视图级描述来支持局部动作预测,捕捉细粒度语义并缩小指令与环境之间的模态差距。互补地,深度增强空间感知(DSP)模块逐步构建轨迹级深度探索图,提供全局空间布局的粗粒度表示。大量实验表明,SUSA 的层次化表示增强在离散 VLN 基准测试(REVERIE、R2R 和 SOON)上显著提升了导航性能,并且在连续 R2R-CE 基准测试上具有更好的泛化能力。
引用
@article{arxiv.2412.06465,
title = {Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation},
author = {Xuesong Zhang and Yunbo Xu and Jia Li and Ruonan Liu and Zhenzhen Hu},
journal= {arXiv preprint arXiv:2412.06465},
year = {2025}
}
备注
AAAI2026, I14 pages, 12 figures, 11 tables