更少的数据可能更好:通过减少数据集增强离线强化学习
机器学习
2025-02-27 v1
摘要
离线强化学习(RL)代表着RL研究的重大转变,使智能体能够从预收集的数据集中学习,而无需进一步与环境交互。离线RL的一个关键但未被充分探索的挑战是选择一个最优的数据子集,以提高算法性能和训练效率。减少数据集大小还可以揭示解决类似问题所必需的最小数据要求。针对这一挑战,我们引入了ReDOR(Reduced Datasets for Offline RL),一种将数据选择框定为梯度逼近优化问题的方法。我们展示了RL中广泛使用的演员-评论家框架可以被重新表述为子可分优化目标,从而实现高效的子集选择。为此,我们改进了正交匹配追踪(OMP),并针对离线RL引入了若干新颖的修改。我们的实验结果表明,ReDOR识别的数据子集不仅能提升算法性能,还能以显著更低的计算复杂度实现。
引用
@article{arxiv.2502.18955,
title = {Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset},
author = {Yiqin Yang and Quanwei Wang and Chenghao Li and Hao Hu and Chengjie Wu and Yuhua Jiang and Dianyu Zhong and Ziyou Zhang and Qianchuan Zhao and Chongjie Zhang and Xu Bo},
journal= {arXiv preprint arXiv:2502.18955},
year = {2025}
}