利用动作影响规律性与外生状态变量进行离线强化学习
机器学习
2023-05-16 v5
摘要
离线强化学习——从一批数据中学习策略——已知对一般 MDP 而言是困难的。这些结果促使人们需要考察离线强化学习可能可行的特定 MDP 类别。在本工作中,我们探索一类受限的 MDP 以获得离线强化学习的保证。其关键性质,我们称之为动作影响规律性(AIR),即动作主要影响状态的一部分(内生分量)而对状态剩余部分(外生分量)影响有限。AIR 是一个强假设,但它在包括金融市场在内的若干真实领域成立。我们讨论了利用 AIR 性质的算法,并基于 Fitted-Q Iteration 给出了一个算法的理论分析。最后,我们证明在规律性成立的模拟与真实环境中,该算法在不同数据收集策略下优于现有离线强化学习算法。
引用
@article{arxiv.2111.08066,
title = {Exploiting Action Impact Regularity and Exogenous State Variables for Offline Reinforcement Learning},
author = {Vincent Liu and James R. Wright and Martha White},
journal= {arXiv preprint arXiv:2111.08066},
year = {2023}
}