COOPO:循环离线-在线策略优化算法
机器学习
2026-05-19 v1 人工智能
摘要
离线强化学习因静态数据集的限制而面临分布偏移和受限性能的困境,而在线 RL 则需要极多的环境交互。最近出现的混合离线到在线方法连接了这两个领域,但在过渡期间存在分布漂移和离线知识的灾难性遗忘问题。我们引入了 COOPO(循环离线-在线策略优化),这是一个在受限离线训练和在线微调之间反复循环的通用框架。每个周期首先通过 KL 正则化的优势加权离线更新将策略锚定到数据集,以最小化分布偏移,然后使用任意策略优化对其进行在线微调,以实现稳定探索。至关重要的是,定期返回离线训练消除了遗忘和漂移,同时最大化了数据集的重复利用率。这种循环行为还有助于减少在线环境交互。在理论上,COOPO 实现了更好的在线样本效率,超越了纯在线 RL,并在标准覆盖假设下保证了单调改进。广泛的 D4RL 基准测试表明,与 SOTA 混合方法相比,COOPO 减少了在线交互,同时提高了最终回报,在各种离线算法和在线优化器中保持了鲁棒性。这种循环协同为自适应 RL 设定了新的效率和性能标准。
引用
@article{arxiv.2605.18675,
title = {COOPO: Cyclic Offline-Online Policy Optimization Algorithm},
author = {Qisai Liu and Zhanhong Jiang and Joshua Russell Waite and Aditya Balu and Cody Fleming and Soumik Sarkar},
journal= {arXiv preprint arXiv:2605.18675},
year = {2026}
}