中文

FM-IRL:强化学习中的流匹配奖励建模与策略正则化

机器学习 2025-10-14 v2

摘要

流匹配(FM)在建模复杂分布方面展现出显著能力,并在离线模仿学习以克隆专家行为方面取得了强劲性能。然而,尽管具有行为克隆的表达能力,基于FM的策略本质上受限于其缺乏环境交互和探索。这导致在专家演示之外的未见场景中泛化能力不足,强调了与环境进行在线交互的必要性。不幸的是,由于梯度计算的不稳定性和高推理成本,通过在线交互优化FM策略具有挑战性且效率低下。为了解决这些问题,我们提出让具有简单MLP结构的学生策略探索环境,并通过带有奖励模型的RL算法进行在线更新。该奖励模型与一个包含专家数据分布丰富信息的教师FM模型相关联。此外,同一教师FM模型被用于正则化学生策略的行为以稳定策略学习。由于学生架构简单,我们避免了FM策略的梯度不稳定问题并实现了高效的在线探索,同时仍利用了教师FM模型的表达能力。大量实验表明,我们的方法显著提升了学习效率、泛化能力和鲁棒性,尤其是在从次优专家数据学习时。

关键词

引用

@article{arxiv.2510.09222,
  title  = {FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning},
  author = {Zhenglin Wan and Jingxuan Wu and Xingrui Yu and Chubin Zhang and Mingcong Lei and Bo An and Ivor Tsang},
  journal= {arXiv preprint arXiv:2510.09222},
  year   = {2025}
}

备注

20 pages