ROAD:基于双层优化的离线到在线强化学习自适应数据混合方法
机器学习
2026-05-15 v1 人工智能
摘要
离线到在线强化学习利用离线预训练的稳定性和在线微调的灵活性。关键挑战在于离线数据集与演化中的在线策略之间的非平稳分布迁移。常见方法依赖静态混合比例或基于经验的回放策略,缺乏对不同环境和变化训练动力学的适应性,导致在稳定性和渐近性能之间的tradeoff次优。本文提出 Reinforcement Learning with Optimized Adaptive Data-mixing (ROAD),一种动态即插即用框架,自动化数据回放过程。我们识别到现有方法中的根本目标错位。在此基础上,我们将数据选择问题形式化为双层优化过程,将数据混合策略解释为在在线微调期间(外层)控制策略性能的元决策,而常规 Q-learning 更新在内层运行。为使其可计算,我们提出一种实用算法,使用多臂老虎机机制,由近似双层梯度的替代目标指导,该目标同时维持离线先验并防止值过度估计。我们的实验结果表明,该方法在各种数据集上 consistently 优于现有数据回放方法,无需手动、特定于情境的调整,同时实现卓越的稳定性和渐近性能。
引用
@article{arxiv.2605.14497,
title = {ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization},
author = {Letian Yang and Xu Liu and Yiqiang Lu and Jian Liu and Weiqiang Wang and Shuai Li},
journal= {arXiv preprint arXiv:2605.14497},
year = {2026}
}
备注
20 pages, 9 figures, 7 tables. Accepted to IJCAI 2026