面向非平稳环境的离线强化学习中的预测
机器学习
2025-12-30 v3 人工智能
机器人学
摘要
离线强化学习(RL)提供了一个从预收集的数据集中训练策略的有前景的途径,适用于无法收集额外交互数据的情形。然而,现有的离线 RL 方法通常假设平稳性或仅考虑测试时的合成扰动,这些假设在现实世界情形中常常失败,后者以突发、随时间变化的偏移为特征。这些偏移可能导致部分可观测性,使代理人误认为自己的真实状态,从而降低性能。为克服这一挑战,我们引入了面向非平稳离线强化学习中的预测(FORL)框架,该框架统一了(i)基于条件扩散的候选状态生成,训练时不预设未来非平稳性的任何特定模式,以及(ii)零样本时间序列基础模型。FORL 针对可能出现意外、可能非马尔可夫偏移的环境,要求从每个 episode 开始就具备稳健的代理人性能。经典评估在离线 RL 基准测试上进行,使用增强后的真实时间序列数据以模拟现实中的非平稳性,结果表明 FORL 相对于竞争基线始终能够提高性能。通过将零样本预测与代理人的经验相集成,我们旨在弥合离线 RL 与现实世界非平稳环境之间的鸿沟。
引用
@article{arxiv.2512.01987,
title = {Forecasting in Offline Reinforcement Learning for Non-stationary Environments},
author = {Suzan Ece Ada and Georg Martius and Emre Ugur and Erhan Oztop},
journal= {arXiv preprint arXiv:2512.01987},
year = {2025}
}
备注
The Thirty-Ninth Annual Conference on Neural Information Processing Systems, NeurIPS 2025