DeepAveragers:通过求解导出的非参数 MDP 进行离线强化学习
机器学习
2025-02-06 v2 人工智能
机器学习
摘要
我们研究了一种基于最优求解从静态经验数据集导出的有限表示 MDP 的离线强化学习(RL)方法。该方法可应用于任何学习到的表征之上,并有可能轻松支持多解决方案目标以及对环境与目标的零样本调整。我们的主要贡献是引入带代价的深度平均器 MDP(DAC-MDP)并研究其用于离线 RL 的求解。DAC-MDP 是一种非参数模型,可利用深度表征,并通过为利用模型中代表性不足的部分引入代价来应对有限数据。在理论上,我们给出了可用来对 DAC-MDP 解的性能进行下界界定的条件。我们还在若干环境中(包括基于图像观测的环境)研究了其经验行为。总体而言,实验表明该框架可在实践中运作并扩展到大型复杂离线 RL 问题。
引用
@article{arxiv.2010.08891,
title = {DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs},
author = {Aayam Shrestha and Stefan Lee and Prasad Tadepalli and Alan Fern},
journal= {arXiv preprint arXiv:2010.08891},
year = {2025}
}
备注
Camera Ready ICLR 2021