展示你的离线强化学习工作:在线评估预算至关重要
机器学习
2022-06-07 v3 人工智能
摘要
在本文中,我们论证了在线评估预算对于深度离线强化学习(offline RL)算法可靠比较的重要性。首先,我们阐明在线评估预算依赖于具体问题,某些问题允许较小的预算而另一些则允许较大的预算。其次,我们证明了在机器人学、金融与能源管理等多种决策领域之中,算法间的优劣偏好依赖于预算。基于上述观点,我们建议在不同在线评估预算下报告深度离线RL算法的性能。为此,我们提议使用来自自然语言处理(NLP)领域的报告工具——期望验证性能(Expected Validation Performance)。该技术在无需超出超参数搜索的额外计算的情况下,即可可靠估计不同预算下的期望最大性能。通过采用该工具,我们还表明在有限预算内工作时,行为克隆(Behavioral Cloning)往往比离线RL算法更具优势。
引用
@article{arxiv.2110.04156,
title = {Showing Your Offline Reinforcement Learning Work: Online Evaluation Budget Matters},
author = {Vladislav Kurenkov and Sergey Kolesnikov},
journal= {arXiv preprint arXiv:2110.04156},
year = {2022}
}
备注
ICML 2022, Spotlight; https://tinkoff-ai.github.io/eop/