中文

具有扰动数据源的可证明高效离线强化学习

机器学习 2023-06-16 v1 信息论 机器学习 math.IT

摘要

现有的离线强化学习(RL)理论研究大多考虑从目标任务直接采样得到的数据集。然而在实践中,数据往往来自若干异构但相关的数据源。受此差距的启发,本文旨在严格理解使用多个数据集的离线 RL,这些数据集采集自目标任务的随机扰动版本而非任务本身。我们推导了一个信息论下界,揭示了除数据样本数量要求外,对涉及数据源数量的必要性要求。随后,提出了一种新颖的 HetPEVI 算法,它同时考虑了每个数据源有限数据样本带来的样本不确定性,以及可用数据源数量有限导致的源不确定性。理论分析表明,只要数据源 collectively 提供良好的数据覆盖,HetPEVI 就能求解目标任务。此外,HetPEVI 被证明在 horizon 长度的多项式因子范围内是最优的。最后,本研究扩展到离线马尔可夫博弈和离线鲁棒 RL,展示了所提设计与理论分析的通用性。

关键词

引用

@article{arxiv.2306.08364,
  title  = {Provably Efficient Offline Reinforcement Learning with Perturbed Data Sources},
  author = {Chengshuai Shi and Wei Xiong and Cong Shen and Jing Yang},
  journal= {arXiv preprint arXiv:2306.08364},
  year   = {2023}
}

备注

ICML 2023