中文

用于交互式导航的视觉后见之明自我模仿学习

人工智能 2024-06-21 v1

摘要

交互式视觉导航任务涉及遵循指令到达并与特定目标交互,其挑战不仅在于成功经验非常稀少,还在于复杂的视觉输入需要大量样本。以往的方法通常依赖精心设计的密集奖励或使用昂贵的专家数据进行模仿学习。为了解决这些挑战,我们提出了一种新方法——视觉后见之明自我模仿学习(VHS),通过后见目标重标记和自我模仿来提高样本效率。我们还引入了一种从经验目标观测中导出的原型目标嵌入方法,该方法在基于视觉和部分可观测环境中特别有效。这种嵌入技术允许智能体视觉上重新解释其失败尝试,从而实现基于视觉的目标重标记和从增强的成功经验中进行自我模仿。实验结果表明,VHS在交互式视觉导航任务中优于现有技术,证实了其优越的性能和样本效率。

关键词

引用

@article{arxiv.2312.03446,
  title  = {Visual Hindsight Self-Imitation Learning for Interactive Navigation},
  author = {Kibeom Kim and Kisung Shin and Min Whoo Lee and Moonhoen Lee and Minsu Lee and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:2312.03446},
  year   = {2024}
}

备注

14 pages, 9 figures and under-review