中文

面向自适应收集数据的强化学习离线策略评估

机器学习 2024-05-02 v2 人工智能

摘要

为离线强化学习方法的样本复杂度建立理论保证,是使数据饥渴的 RL 算法具备实际可行性的重要一步。目前,多数结果依赖于关于数据分布的不现实假设——即数据由单一记录策略收集的一组独立同分布轨迹组成。我们考虑一种更通用的设定,其中数据集可能是自适应收集的。针对表格型 MDP,我们在该广义设定下发展了 TMIS 离线策略评估(OPE)估计器的理论,推导了其估计误差的高概率、依赖于具体实例的界。我们还在自适应设定下恢复了极小极大最优的离线学习。最后,我们进行了仿真,以实证分析这些估计器在自适应与非自适应机制下的行为。

关键词

引用

@article{arxiv.2306.14063,
  title  = {Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data},
  author = {Sunil Madhow and Dan Qiao and Ming Yin and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2306.14063},
  year   = {2024}
}