离线强化学习中自然随机策略的高效评估
机器学习
2020-11-05 v2 最优化与控制
机器学习
摘要
我们研究自然随机策略的离策略高效评估,该类策略由相对于行为策略的偏差所定义。这有别于离策略评估的文献,其中多数工作考虑显式指定策略的评估。关键的是,采用自然随机策略的离线强化学习有助于缓解弱重叠问题,产生基于当前实践构建的策略,并提升策略在实际中的可实施性。与预先指定评估策略的经典情形相比,在评估自然随机策略时,衡量最佳可达估计误差的效率界因评估策略本身未知而被放大。在本文中,我们推导了两类主要自然随机策略——倾斜策略与修正处理策略——的效率界。随后我们提出了在非常宽松条件下达到效率界的高效非参数估计量。这些估计量还具备(部分)双重鲁棒性。
引用
@article{arxiv.2006.03886,
title = {Efficient Evaluation of Natural Stochastic Policies in Offline Reinforcement Learning},
author = {Nathan Kallus and Masatoshi Uehara},
journal= {arXiv preprint arXiv:2006.03886},
year = {2020}
}
备注
Under review