中文

用于非平稳强化学习的小波预测表示

机器学习 2025-10-07 v1

摘要

现实世界是 inherently non-stationary 的,包含不断变化的因素,如天气条件和交通流量,这使得智能体难以适应不断变化的环境动态。非平稳强化学习(NSRL)通过训练智能体以快速适应一系列不同马尔可夫决策过程(MDP)的序列来应对这一挑战。然而,现有NSRL方法往往专注于模式演化规律较为规则的任务,在高度动态环境中适应性有限。灵感来自小波分析在时间序列建模中的成功,特别是其捕获多尺度信号趋势的能力,我们提出WISDOM,通过小波域预测任务表示来增强NSRL。WISDOM通过将任务表示序列转换到小波域,捕获演化中MDP序列的多尺度特征,其中小波系数既代表非平稳变化的全局趋势,也代表细粒度的变动。在除常规时间序列预测中使用的自回归建模之外,我们设计了一种小波时序差(TD)更新算子来增强对MDP演化的跟踪和预测。我们理论证明了该算子的收敛性,并演示了使用小波任务表示的策略改进。实验在多样化基准测试上表明,WISDOM在样本效率和渐近性能方面显著优于现有基线,展示了其在非平稳且随机演化任务中显著的适应性。

关键词

引用

@article{arxiv.2510.04507,
  title  = {Wavelet Predictive Representations for Non-Stationary Reinforcement Learning},
  author = {Min Wang and Xin Li and Ye He and Yao-Hui Li and Hasnaa Bennis and Riashat Islam and Mingzhong Wang},
  journal= {arXiv preprint arXiv:2510.04507},
  year   = {2025}
}