中文

非平稳强化学习中的节奏自适应

机器学习 2023-10-31 v2

摘要

我们首先提出并解决了非平稳强化学习(RL)中智能体与环境之间的“时间同步”问题,这是阻碍其实世界应用的关键因素。现实中,环境变化发生于挂钟时间(tt)而非回合进度(kk)上,其中挂钟时间表示固定时长 t[0,T]t \in [0, T] 内的实际流逝时间。在现有工作中,于回合 kk,智能体滚动一条轨迹并训练策略,然后转入回合 k+1k+1。然而,在时间失同步的环境中,时刻 tkt_{k} 的智能体分配 Δt\Delta t 用于轨迹生成与训练,随后在 tk+1=tk+Δtt_{k+1}=t_{k}+\Delta t 进入下一回合。尽管总回合数(KK)固定,智能体因交互时刻选择(t1,t2,...,tKt_1,t_2,...,t_K)不同而累积不同轨迹,显著影响策略的次优间隙。我们提出主动同步节奏(ProST\texttt{ProST})框架,通过最小化其性能度量(即动态后悔)的上界来计算次优序列 {t1,t2,...,tKt_1,t_2,...,t_K}(= { t1:Kt_{1:K}})。我们的主要贡献在于表明次优 {t1:Kt_{1:K}} 在策略训练时间(智能体节奏)与环境变化快慢(环境节奏)之间做了权衡。理论上,本工作将次优 {t1:Kt_{1:K}} 发展为环境非平稳程度的函数,同时实现次线性动态后悔。我们在多种高维非平稳环境中的实验评估表明,ProST\texttt{ProST} 框架在次优 {t1:Kt_{1:K}} 下比现有方法取得更高的在线回报。

关键词

引用

@article{arxiv.2309.14989,
  title  = {Tempo Adaptation in Non-stationary Reinforcement Learning},
  author = {Hyunin Lee and Yuhao Ding and Jongmin Lee and Ming Jin and Javad Lavaei and Somayeh Sojoudi},
  journal= {arXiv preprint arXiv:2309.14989},
  year   = {2023}
}

备注

53 pages. To be published in Neural Information Processing Systems (NeurIPS), 2023