非平稳上下文驱动环境中的在线强化学习
机器学习
2025-04-01 v4 人工智能
摘要
我们研究非平稳环境中的在线强化学习(RL),其中时变的外源上下文过程影响环境动态。在此类环境中,由于“灾难性遗忘”(CF),在线RL具有挑战性。智能体在训练新经验时倾向于忘记先前的知识。缓解此问题的先前方法假设任务标签(在实践中通常不可用),采用脆弱的正则化启发式方法,或使用遭受不稳定性和性能不佳影响的离策略方法。我们提出了局部约束策略优化(LCPO),这是一种在线RL方法,通过将策略输出锚定在旧经验上,同时优化当前经验的回报来对抗CF。为了执行这种锚定,LCPO使用来自当前上下文分布之外的经验样本来局部约束策略优化。我们在具有各种合成和真实上下文轨迹的Mujoco、经典控制和计算机系统环境中评估了LCPO,发现它在非平稳设置中优于多种基线方法,同时取得了与在所有上下文轨迹上离线训练的“先知”智能体相当的结果。LCPO的源代码可在https://github.com/pouyahmdn/LCPO获取。
引用
@article{arxiv.2302.02182,
title = {Online Reinforcement Learning in Non-Stationary Context-Driven Environments},
author = {Pouya Hamadanian and Arash Nasr-Esfahany and Malte Schwarzkopf and Siddartha Sen and Mohammad Alizadeh},
journal= {arXiv preprint arXiv:2302.02182},
year = {2025}
}
备注
ICLR '25 Spotlight