EfficientZero V2:利用有限数据掌握离散与连续控制
机器学习
2024-09-13 v2 人工智能
机器人学
摘要
样本效率仍然是将强化学习 (Reinforcement Learning, RL) 应用于现实世界任务的关键挑战。虽然近期算法在提高样本效率方面取得了重大进展,但没有任何算法能在不同领域 consistently 实现卓越性能。在本文中,我们介绍了 EfficientZero V2,这是一个专为样本高效 RL 算法设计的通用框架。我们将 EfficientZero 的性能扩展到了多个领域,涵盖连续和离散动作,以及视觉和低维输入。通过我们提出的一系列改进,EfficientZero V2 在有限数据设置下的多样化任务中,以显著优势超越了当前的最新技术 (SOTA)。EfficientZero V2 相较于现行的通用算法 DreamerV3 表现出显著进步,在 Atari 100k、本体感觉控制 (Proprio Control) 和视觉控制 (Vision Control) 等不同基准测试的 66 个评估任务中,有 50 个任务取得了更优结果。
引用
@article{arxiv.2403.00564,
title = {EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data},
author = {Shengjie Wang and Shaohuai Liu and Weirui Ye and Jiacheng You and Yang Gao},
journal= {arXiv preprint arXiv:2403.00564},
year = {2024}
}
备注
21 pages,10 figures