dFlowGRPO:面向离散流模型的速率感知策略优化
机器学习
2026-05-12 v1 应用统计
摘要
离散流模型(DFMs)是一类用于生成离散数据的灵活生成模型,扩散大语言模型(dLLMs)可视为一种特定混合路径和掩码源分布的特殊情况。虽然近期多个研究探索了将强化学习应用于dLLMs,但其对更广泛离散流模型的应用仍鲜有探索。本文提出离散Flow-GRPO(dFlowGRPO),一个统一的强化学习框架,支持广泛的概率路径和非掩码源分布。我们推导了DFMs的完整轨迹概率,将去噪建模为马尔可夫决策过程,使dFlowGRPO能够在强化学习过程中融合关联条件转移率和后验模型的信息。我们将dFlowGRPO应用于FUDOKI,这是一个最近的多模态离散流模型,并在图像生成和多模态理解任务上进行评估。实验结果表明,dFlowGRPO在文本到图像生成任务上优于现有的GRPO类方法,用于dLLMs,同时在使用FlowGRPO训练的连续流模型性能相当,同时在理解任务上也表现出色。
引用
@article{arxiv.2605.09291,
title = {dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models},
author = {Zhengyan Wan and Yidong Ouyang and Panwen Hu and Qiang Sun},
journal= {arXiv preprint arXiv:2605.09291},
year = {2026}
}