中文

利用动作影响规律性与外生状态变量进行离线强化学习

机器学习 2023-05-16 v5

摘要

离线强化学习——从一批数据中学习策略——已知对一般 MDP 而言是困难的。这些结果促使人们需要考察离线强化学习可能可行的特定 MDP 类别。在本工作中,我们探索一类受限的 MDP 以获得离线强化学习的保证。其关键性质,我们称之为动作影响规律性(AIR),即动作主要影响状态的一部分(内生分量)而对状态剩余部分(外生分量)影响有限。AIR 是一个强假设,但它在包括金融市场在内的若干真实领域成立。我们讨论了利用 AIR 性质的算法,并基于 Fitted-Q Iteration 给出了一个算法的理论分析。最后,我们证明在规律性成立的模拟与真实环境中,该算法在不同数据收集策略下优于现有离线强化学习算法。

关键词

引用

@article{arxiv.2111.08066,
  title  = {Exploiting Action Impact Regularity and Exogenous State Variables for Offline Reinforcement Learning},
  author = {Vincent Liu and James R. Wright and Martha White},
  journal= {arXiv preprint arXiv:2111.08066},
  year   = {2023}
}