非平稳强化学习中的节奏自适应
机器学习
2023-10-31 v2
摘要
我们首先提出并解决了非平稳强化学习(RL)中智能体与环境之间的“时间同步”问题,这是阻碍其实世界应用的关键因素。现实中,环境变化发生于挂钟时间()而非回合进度()上,其中挂钟时间表示固定时长 内的实际流逝时间。在现有工作中,于回合 ,智能体滚动一条轨迹并训练策略,然后转入回合 。然而,在时间失同步的环境中,时刻 的智能体分配 用于轨迹生成与训练,随后在 进入下一回合。尽管总回合数()固定,智能体因交互时刻选择()不同而累积不同轨迹,显著影响策略的次优间隙。我们提出主动同步节奏()框架,通过最小化其性能度量(即动态后悔)的上界来计算次优序列 {}(= { })。我们的主要贡献在于表明次优 {} 在策略训练时间(智能体节奏)与环境变化快慢(环境节奏)之间做了权衡。理论上,本工作将次优 {} 发展为环境非平稳程度的函数,同时实现次线性动态后悔。我们在多种高维非平稳环境中的实验评估表明, 框架在次优 {} 下比现有方法取得更高的在线回报。
引用
@article{arxiv.2309.14989,
title = {Tempo Adaptation in Non-stationary Reinforcement Learning},
author = {Hyunin Lee and Yuhao Ding and Jongmin Lee and Ming Jin and Javad Lavaei and Somayeh Sojoudi},
journal= {arXiv preprint arXiv:2309.14989},
year = {2023}
}
备注
53 pages. To be published in Neural Information Processing Systems (NeurIPS), 2023