有限历史智能体-环境交互下的离线策略比较
机器学习
2021-06-09 v1 人工智能
摘要
我们解决了强化学习系统在实际应用中的策略评估挑战,其中由于伦理、实际或安全考虑,可用的历史数据有限。这种受限的数据样本分布常导致有偏的策略评估估计。为此,我们提出不应进行策略评估,而应进行策略比较,即基于可用历史数据按价值对感兴趣的策略进行排序。此外,我们提出了有限数据估计器(LDE)作为一种从少量与环境交互中评估和比较策略的简单方法。根据我们的理论分析,在关于历史数据分布的温和假设下,LDE在策略比较任务上被证明是统计可靠的。另外,我们的数值实验在策略排序任务上将LDE与其他策略评估方法进行比较,并展示了其在多种设置下的优势。
引用
@article{arxiv.2106.03934,
title = {Offline Policy Comparison under Limited Historical Agent-Environment Interactions},
author = {Anton Dereventsov and Joseph D. Daws and Clayton Webster},
journal= {arXiv preprint arXiv:2106.03934},
year = {2021}
}