警惕强化学习中的瞬时依赖性
机器学习
2023-03-10 v1
摘要
环境模型在基于模型的强化学习(MBRL)中扮演重要角色,旨在基于过去预测未来状态。现有工作通常忽略状态中的瞬时依赖性,即假设在给定过去状态的条件下未来状态变量条件独立。然而,瞬时依赖性在许多 RL 环境中普遍存在。例如,在股市中,两只股票之间可能存在瞬时依赖性,因为一只股票的波动会迅速影响另一只,且价格变动的分辨率低于该影响的速率。在本文中,我们证明除少数例外,忽略瞬时依赖性会导致 MBRL 中的次优策略学习。为解决该次优问题,我们提出一种简单的即插即用方法,使现有 MBRL 算法能够考虑瞬时依赖性。通过在两个基准上的实验,我们(1)通过可视化确认了瞬时依赖性的存在;(2)验证了我们的理论发现,即忽略瞬时依赖性导致次优策略;(3)证实我们的方法有效实现了考虑瞬时依赖性的强化学习并提升了策略性能。
引用
@article{arxiv.2303.05458,
title = {Beware of Instantaneous Dependence in Reinforcement Learning},
author = {Zhengmao Zhu and Yuren Liu and Honglong Tian and Yang Yu and Kun Zhang},
journal= {arXiv preprint arXiv:2303.05458},
year = {2023}
}