中文

非平稳上下文驱动环境中的在线强化学习

机器学习 2025-04-01 v4 人工智能

摘要

我们研究非平稳环境中的在线强化学习(RL),其中时变的外源上下文过程影响环境动态。在此类环境中,由于“灾难性遗忘”(CF),在线RL具有挑战性。智能体在训练新经验时倾向于忘记先前的知识。缓解此问题的先前方法假设任务标签(在实践中通常不可用),采用脆弱的正则化启发式方法,或使用遭受不稳定性和性能不佳影响的离策略方法。我们提出了局部约束策略优化(LCPO),这是一种在线RL方法,通过将策略输出锚定在旧经验上,同时优化当前经验的回报来对抗CF。为了执行这种锚定,LCPO使用来自当前上下文分布之外的经验样本来局部约束策略优化。我们在具有各种合成和真实上下文轨迹的Mujoco、经典控制和计算机系统环境中评估了LCPO,发现它在非平稳设置中优于多种基线方法,同时取得了与在所有上下文轨迹上离线训练的“先知”智能体相当的结果。LCPO的源代码可在https://github.com/pouyahmdn/LCPO获取。

关键词

引用

@article{arxiv.2302.02182,
  title  = {Online Reinforcement Learning in Non-Stationary Context-Driven Environments},
  author = {Pouya Hamadanian and Arash Nasr-Esfahany and Malte Schwarzkopf and Siddartha Sen and Mohammad Alizadeh},
  journal= {arXiv preprint arXiv:2302.02182},
  year   = {2025}
}

备注

ICLR '25 Spotlight