中文

离线强化学习的数据集视角

机器学习 2022-07-13 v2 人工智能

摘要

由于训练期间策略次优,强化学习(RL)在真实世界环境中的应用可能代价高昂或存在风险。在离线 RL 中,由于禁止与环境交互,该问题得以避免。策略从给定数据集中学习,而数据集单独决定了它们的性能。尽管有此事实,数据集特征如何影响离线 RL 算法仍鲜有研究。数据集特征由采样该数据集的行为策略决定。因此,我们将行为策略的特征定义为探索性的(在与马尔可夫决策过程(MDP)的交互中产生高期望信息)与利用性的(具有高期望回报)。我们在确定性 MDP 中针对行为策略采样的数据集实现了两种相应的经验度量。第一个经验度量 SACo 由归一化唯一状态-动作对定义,刻画探索。第二个经验度量 TQ 由归一化平均轨迹回报定义,刻画利用。经验评估显示了 TQ 与 SACo 的有效性。在使用我们所提度量的大规模实验中,我们表明无约束离策略 Deep Q-Network 族需要具有高 SACo 的数据集才能找到良好策略。此外,实验表明策略约束算法在高 TQ 与高 SACo 的数据集上表现良好。最后,实验表明,对于具有高 TQ 的数据集,纯数据集约束的行为克隆(Behavioral Cloning)可与最佳离线 RL 算法相竞争。

关键词

引用

@article{arxiv.2111.04714,
  title  = {A Dataset Perspective on Offline Reinforcement Learning},
  author = {Kajetan Schweighofer and Andreas Radler and Marius-Constantin Dinu and Markus Hofmarcher and Vihang Patil and Angela Bitto-Nemling and Hamid Eghbal-zadeh and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:2111.04714},
  year   = {2022}
}

备注

Code: https://github.com/ml-jku/OfflineRL