中文

基于离线 RL 的视觉语言导航规模化

计算机视觉与模式识别 2024-03-28 v1

摘要

视觉语言导航 (VLN) 的研究通常依赖专家轨迹,但由于收集它们需要巨大的工作量,在现实世界情境下可能难以获得。相反,现有的训练 VLN agent 的方法要么依赖数据增强,要么依赖在线探索,这两种方法都繁琐且风险大。相比之下,容易获取大量次优 offline 轨迹。以离线强化学习 (ORL) 的研究为灵感,我们引入了新的 VLN-ORL 问题设置,用于次优演示数据进行 VLN。我们引入一种简单且有效的 reward-conditioned 方法,可为训练 VLN agent 处理数据集次优性提供支持,同时也提出了评估进展和推动该领域研究的基准。我们经验性地研究了 various noise models 用于表征数据集次优性等 VLN-ORL 的其他独特挑战,并为 VLN\circlearrowrightBERT 和 MTVM 架构在 R2R 和 RxR 环境中实现了该方法。我们的实验表明,所提出的 reward-conditioned 方法即使在复杂且错综复杂的环境中,也能显著提升性能。

关键词

引用

@article{arxiv.2403.18454,
  title  = {Scaling Vision-and-Language Navigation With Offline RL},
  author = {Valay Bundele and Mahesh Bhupati and Biplab Banerjee and Aditya Grover},
  journal= {arXiv preprint arXiv:2403.18454},
  year   = {2024}
}

备注

Published in Transactions on Machine Learning Research (04/2024)