中文

适应性回放缓冲区用于离线到在线强化学习

机器学习 2026-04-09 v2 人工智能

摘要

离线到在线强化学习 (Offline-to-Online Reinforcement Learning, O2O RL) 面临在固定离线数据集与新收集的在线经验之间进行权衡的关键困境。常用方法通常依赖固定的数据混合比例,难以管理早期学习稳定性与渐近性能之间的权衡。为克服此困难,我们引入适应性回放缓冲区 (Adaptive Replay Buffer, ARB),这是一种 novel 方法,通过轻量级度量‘策略符合度’动态优先级数据采样。不同于依赖复杂学习程序或固定比例的先前方法,ARB 设计为无学习、易于实现,无缝集成到现有的 O2O RL 算法中。它评估收集的轨迹如何与当前策略的行为相吻合,并为该轨迹中每个转换分配比例采样权重。该策略有效地利用离线数据实现初始稳定性,同时逐渐聚焦于最相关的高奖励在线经验。我们在 D4RL 基准测试中进行大量实验,证明 ARB 持续缓解早期性能下降,显著提高各种 O2O RL 算法的最终性能,凸显适应性、行为感知回放缓冲区设计的重要性。我们的代码已公开于 https://github.com/song970407/ARB。

关键词

引用

@article{arxiv.2512.10510,
  title  = {Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning},
  author = {Chihyeon Song and Jaewoo Lee and Jinkyoo Park},
  journal= {arXiv preprint arXiv:2512.10510},
  year   = {2026}
}

备注

AISTATS 2026