ARMOR: 一种基于模型的利用离线数据改进任意基线策略的框架
机器学习
2022-11-10 v1 人工智能
摘要
我们提出一种新的基于模型的离线强化学习框架,称为离线强化学习的对抗模型(ARMOR),它能够稳健地学习策略以改进任意基线策略,而不受数据覆盖的限制。基于相对悲观主义的概念,ARMOR 被设计为在面对不确定性时优化最坏情况下的相对性能。在理论上,我们证明 ARMOR 所学得的策略在任何可容许超参数下都不会使基线策略的性能退化,并且当超参数被良好调节且基线策略由数据支持时,能够学习到与数据覆盖范围内最优策略相竞争的策略。这种稳健的策略改进特性使 ARMOR 特别适合构建现实世界的学习系统,因为在实践中,在考虑学习能带来的任何益处之前,确保无性能退化是必需的。
引用
@article{arxiv.2211.04538,
title = {ARMOR: A Model-based Framework for Improving Arbitrary Baseline Policies with Offline Data},
author = {Tengyang Xie and Mohak Bhardwaj and Nan Jiang and Ching-An Cheng},
journal= {arXiv preprint arXiv:2211.04538},
year = {2022}
}