中文

基于能量的视觉语言导航方法

计算机视觉与模式识别 2024-10-21 v1

摘要

视觉语言导航 (VLN) 需要智能体根据人类指令执行动作。现有的VLN模型通过专家演示进行监督行为克隆或 incorporates 手动奖励工程进行优化。虽然 straightforward,但这些做法忽略了马尔可夫决策过程中的误差累积,难以匹配专家策略的分布。超越这些限制,我们提出了一种能量基于导航策略 (ENP),通过能量模型来建模联合状态-动作分布。在每一步中,低能量值对应专家最可能执行的状态-动作对,反之亦然。理论上,优化目标等价于最小化专家占用度量与我们之间的前向散度。因此,ENP通过最大化动作的似然性并以协作方式建模导航状态的动力学,从而学习到与专家策略全局对齐。该方法在R2R、REVERIE、RxR和R2R-CE等多个VLN架构上实现了令人瞩目的性能,释放了现有VLN模型的潜能。

关键词

引用

@article{arxiv.2410.14250,
  title  = {Vision-Language Navigation with Energy-Based Policy},
  author = {Rui Liu and Wenguan Wang and Yi Yang},
  journal= {arXiv preprint arXiv:2410.14250},
  year   = {2024}
}