中文

面向离线强化学习的流式演员-评论家

机器学习 2026-02-23 v1 人工智能

摘要

离线强化学习(RL)中的数据分布往往呈现复杂和多模态分布, necessitating 使用表达力更强的策略来捕捉这些分布,而不仅仅是广泛使用的高斯策略。为处理此类复杂和多模态数据集,本文提出Flow Actor-Critic(流式演员-评论家),一种基于最新流策略的离线RL新型演员-评论家方法。该方法不仅将流模型用于演员,如前述流策略一样,还利用表达力强的流模型来实现保守的评论家获取,以防止超出数据区域的Q值爆炸。为此,我们提出了一种基于流行为代理模型的新型评论家正则化器,该代理模型作为流基于演员设计的副产品。通过这种方式利用流模型,我们在D4RL和最新OGBench基准测试的测试数据集上实现了新的最先进性能。

关键词

引用

@article{arxiv.2602.18015,
  title  = {Flow Actor-Critic for Offline Reinforcement Learning},
  author = {Jongseong Chae and Jongeui Park and Yongjae Shin and Gyeongmin Kim and Seungyul Han and Youngchul Sung},
  journal= {arXiv preprint arXiv:2602.18015},
  year   = {2026}
}

备注

Accepted to ICLR 2026