离线到在线强化学习的离散流匹配
机器学习
2026-05-13 v1 人工智能
摘要
许多强化学习(RL)任务具有离散动作空间,但大多数基于扩散和流匹配的生成性策略方法都是为连续控制设计的。同时,生成策略通常高度依赖离线数据集,而离线到在线 RL 本身就具有挑战,因为策略必须在不损失从静态数据中学习的有用行为的前提下,从新的交互中实现提升。为此,我们引入了 DRIFT—a一种用于离线预训练连续时间马尔可夫链(CTMC)策略的在线微调方法,通过优势加权离散流匹配损失来更新策略。为保持有用的预训练知识,我们添加了一个路径空间惩罚项,对完整的 CTMC 轨迹分布进行正则化,而不仅仅是最终动作分布。对于大型离散动作空间,我们引入了候选集近似方法,在从参考策略 rollout 和均匀探索中抽样的小型动作子集上更新演员。我们的理论分析表明,候选集误差由遗漏的目标概率质量控制,受控 CTMC 生成器误差随候选集覆盖更多高概率动作而减小。实验在主流离散动作 RL 任务上表明,我们的方法在所有任务上都实现了稳定的离线到在线改进,采用简单 GRU 编码器即可在 Jericho 上获得最高平均得分,优于使用预训练语言模型的方法。受控实验进一步确认,路径空间惩罚在微调期间保持受限,CTMC 生成器能比确定性基线更快地适应移位奖励。候选集机制得到稳定性分析的支持,表明生成器误差随候选覆盖率指数级减小。
引用
@article{arxiv.2605.12379,
title = {Discrete Flow Matching for Offline-to-Online Reinforcement Learning},
author = {Fairoz Nower Khan and Nabuat Zaman Nahim and Peizhong Ju},
journal= {arXiv preprint arXiv:2605.12379},
year = {2026}
}