关于一般跳跃问题:使用 Hopper 环境进行基准选择与设计讨论
机器学习
2024-10-15 v2
摘要
经验、基准驱动的测试是当前强化学习(RL)社区的基本范式。虽然在强化学习中使用现成基准是常见做法,但这种选择极少被讨论。基准选择往往基于直观想法,例如“四足机器人”或“视觉观察”。本文认为,RL 的基准测试需要被视为一个独立的科学学科。为说明这一点,我们对不同的 Hopper 环境变体进行案例研究,表明标准基准测试套件的选择会极大影响我们对算法性能的判断。该领域尚无关于不同 Hopper 环境代表性的统一概念——它们甚至似乎不代表彼此。我们的实验结果表明,深度 RL 文献中存在更大问题:基准选择既不常被公正地论证,也不存在一种可以用于论证某些环境选择的语言。本文 concludes with 对基准测试进行proper讨论和评估要求的讨论,并提出了启动对话步骤。
引用
@article{arxiv.2410.08870,
title = {Can we hop in general? A discussion of benchmark selection and design using the Hopper environment},
author = {Claas A Voelcker and Marcel Hussing and Eric Eaton},
journal= {arXiv preprint arXiv:2410.08870},
year = {2024}
}