中文

面向离线强化学习的可解释性能分析:数据集视角

机器学习 2021-05-13 v1 人工智能

摘要

离线强化学习(RL)因其广泛的真实世界应用而日益成为人工智能研究的焦点,在这些应用中数据收集可能困难、耗时或昂贵。本文中,我们首先从探索与利用倾向的视角对现有离线 RL 算法提出了一个双重分类法。其次,我们推导了外推误差上界的显式表达式,并探究了不同类型算法的性能与状态下动作分布之间的相关性。具体而言,我们放宽了关于充足大量 state-action 元组的严格假设。相应地,我们可证明地解释了为何 batch constrained Q-learning(BCQ)优于其他现有技术。第三,在识别出 BCQ 在低平均回合回报数据集上的弱点后,我们提出了一种基于高回报选择机制的改进变体,证明能在多种数据集上获得 state-of-the-art 性能。最后,我们在 Atari 领域创建了一个基准平台,称为 RL easy go(RLEG),估计成本超过 30 万美元。我们将其开源,以便离线 RL 算法间在提供完整数据集与检查点的条件下进行公平且全面的竞赛。

关键词

引用

@article{arxiv.2105.05473,
  title  = {Interpretable performance analysis towards offline reinforcement learning: A dataset perspective},
  author = {Chenyang Xi and Bo Tang and Jiajun Shen and Xinfu Liu and Feiyu Xiong and Xueying Li},
  journal= {arXiv preprint arXiv:2105.05473},
  year   = {2021}
}