指令即状态:基于环境引导和状态条件化的具身导航语义理解
计算机视觉与模式识别
2026-04-21 v1
摘要
视觉语言导航要求智能体在视觉变化的环境中遵循自然语言指令。核心挑战在于语言与观察之间的动态纠缠:随着智能体视野和空间环境的演变,指令的含义也随之变化。然而,许多现有模型将指令编码为静态的全局表示,限制了其根据当前视觉上下文调整指令含义的能力。我们因此将指令理解建模为“指令即状态”变量:一种在感知状态条件下逐步演化的、与决策相关的、基于标记的指令状态,其中感知状态表示每一步中基于观察的导航上下文。为实现这一原则,我们引入了基于状态条件化的环境引导指令理解框架(S-EGIU),该框架包含粗到细的指令片段激活和标记级语义细化。 在粗略阶段,S-EGIU激活与当前观察语义一致的指令片段。在细化阶段,它通过观察引导的标记 grounding 和上下文建模来细化所激活的片段,在当前观察下 Sharpen其内部语义。总体而言,这些阶段在智能体导航期间根据感知状态持续更新指令状态。 S-EGIU 在多个关键指标上均取得优异性能,包括在 REVERIE Test Unseen 上的 +2.68% SPL 提升,以及在多个 VLN 基准测试中展现出一致的效率提升,凸显了动态指令-感知纠缠的价值。
引用
@article{arxiv.2604.18223,
title = {Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation},
author = {Zhen Liu and Yuhan Liu and Jinjun Wang and Jianyi Liu and Wei Song and Jingwen Fu},
journal= {arXiv preprint arXiv:2604.18223},
year = {2026}
}