中文

EfficientZero V2:利用有限数据掌握离散与连续控制

机器学习 2024-09-13 v2 人工智能 机器人学

摘要

样本效率仍然是将强化学习 (Reinforcement Learning, RL) 应用于现实世界任务的关键挑战。虽然近期算法在提高样本效率方面取得了重大进展,但没有任何算法能在不同领域 consistently 实现卓越性能。在本文中,我们介绍了 EfficientZero V2,这是一个专为样本高效 RL 算法设计的通用框架。我们将 EfficientZero 的性能扩展到了多个领域,涵盖连续和离散动作,以及视觉和低维输入。通过我们提出的一系列改进,EfficientZero V2 在有限数据设置下的多样化任务中,以显著优势超越了当前的最新技术 (SOTA)。EfficientZero V2 相较于现行的通用算法 DreamerV3 表现出显著进步,在 Atari 100k、本体感觉控制 (Proprio Control) 和视觉控制 (Vision Control) 等不同基准测试的 66 个评估任务中,有 50 个任务取得了更优结果。

关键词

引用

@article{arxiv.2403.00564,
  title  = {EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data},
  author = {Shengjie Wang and Shaohuai Liu and Weirui Ye and Jiacheng You and Yang Gao},
  journal= {arXiv preprint arXiv:2403.00564},
  year   = {2024}
}

备注

21 pages,10 figures