中文

NavQ:用于预见式视觉语言导航的 Q-模型学习

计算机视觉与模式识别 2025-10-21 v1 机器人学

摘要

本工作聚焦于以目标为导向的视觉语言导航(VLN)任务。现有方法常基于历史信息做出决策,忽视动作的未来影响和长期结果。在此基础上,我们旨在开发具有预见性的智能体。具体而言,我们利用大规模无标签轨迹数据训练 Q-模型,以学习室内场景中布局和物体关系的通用知识。该模型为每个候选动作生成一个Q特征,类似于传统Q网络中的Q值,描述执行特定动作后可能观察到的潜在未来信息。随后,跨模态未来编码器将任务无关的Q特征与导航指令整合,以产生一组反映未来前景的动作得分。这些得分结合基于历史的原始得分,可有效地采用A*风格搜索策略,探索更可能通往目的地的区域。在广泛使用的以目标为导向的VLN数据集上进行的大量实验验证了所提出方法的有效性。

关键词

引用

@article{arxiv.2510.16457,
  title  = {NavQ: Learning a Q-Model for Foresighted Vision-and-Language Navigation},
  author = {Peiran Xu and Xicheng Gong and Yadong MU},
  journal= {arXiv preprint arXiv:2510.16457},
  year   = {2025}
}

备注

ICCV 2025