从静态约束到动态适应:面向离线到在线强化学习的样本级约束松弛
机器学习
2026-05-19 v3
摘要
离线到在线强化学习 (O2O RL) 面临在保留离线保守性与适应在线反馈之间应对分布迁移的核心挑战。这种挑战源于数据行为在微调期间会随之演变,导致数据来源成为约束处理的误导性基础,从而引发目标与数据之间的不匹配。我们因此提出了松弛下的动态对齐 (DARE),这是一个基于行为模型行为一致性的样本级约束松弛的分布感知框架。据我们所知,DARE 是首个依据行为一致性条件化约束松弛的方法,超越了二元的离线/在线数据区分。重要的是,DARE 只需每组样本的行为对齐,即可在许多离线算法之上进行实例化,可灵活选择行为模型和微调目标。我们提供了理论分析,表明基于行为的样本交换持续改善了离线类似与在线类似子集之间的区分。在 D4RL 上的实验表明,DARE 在保持微调稳定性的同时,优于强大的离线到在线基线实现卓越的最终性能。(代码已公开于 \url{https://github.com/lpzu/DARE}.)。
引用
@article{arxiv.2511.03828,
title = {From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning},
author = {Lipeng Zu and Yu Qian and Shayok Chakraborty and Xiaonan Zhang},
journal= {arXiv preprint arXiv:2511.03828},
year = {2026}
}