中文

用于离线到在线强化学习的注入噪声流匹配

机器学习 2026-02-23 v1 人工智能

摘要

生成模型最近在各类领域展现出惊人成功,推动其作为强化学习(RL)中表达性策略的采纳。虽然它们在离线RL中表现出色,尤其是在目标分布明确定义的场景中,但其向在线微调的扩展大多被视为离线预训练的直接延续,未能针对关键挑战予以解决。本文提出一种称为FINO(Flow Matching with Injected Noise for Offline-to-Online RL)的新方法,利用流匹配基于的策略提升离线到在线RL的样本效率。FINO通过注入噪声来促进策略训练中的有效探索,从而鼓励超出离线数据集中观察到的行动范围。除了探索增强的流策略训练外,我们还结合熵导向的采样机制以平衡探索与开发,使策略能够在online微调期间适应其行为。跨越多样化、具挑战性的任务的实验表明,FINO在有限的online预算下始终实现优异性能。

关键词

引用

@article{arxiv.2602.18117,
  title  = {Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning},
  author = {Yongjae Shin and Jongseong Chae and Jongeui Park and Youngchul Sung},
  journal= {arXiv preprint arXiv:2602.18117},
  year   = {2026}
}

备注

ICLR 2026 camera-ready