中文

面向不平衡数据集的离线强化学习

机器学习 2024-05-22 v3 人工智能

摘要

当前离线强化学习(RL)研究对基准的普遍使用,导致在模型开发中忽视了真实世界数据集分布的不平衡性。由于探索困难或安全性考量,真实世界离线 RL 数据集在状态空间上常呈不平衡分布。本文明确了离线 RL 中不平衡数据集的性质:其状态覆盖遵循由偏斜策略刻画的幂律分布。我们从理论与实验上表明,典型的基于分布约束的离线 RL 方法(如保守 Q 学习(CQL))在不平衡数据集下难以有效提取策略。受自然智能启发,我们提出一种新颖的离线 RL 方法,通过对 CQL 增补检索过程以回忆过往相关经验,有效缓解不平衡数据集带来的挑战。我们利用 D4RL 的变体,在具有不同不平衡程度的不平衡数据集语境下对若干任务评估了所提方法。实证结果显示了该方法相对于其他基线的优越性。

关键词

引用

@article{arxiv.2307.02752,
  title  = {Offline Reinforcement Learning with Imbalanced Datasets},
  author = {Li Jiang and Sijie Cheng and Jielin Qiu and Haoran Xu and Wai Kin Chan and Zhao Ding},
  journal= {arXiv preprint arXiv:2307.02752},
  year   = {2024}
}