中文

草图再绘:基于分层强化学习的扩散多模态大语言模型

人工智能 2026-05-19 v1

摘要

扩散多模态大语言模型 (dMLLMs) 在图像生成方面表现强力,但通过强化学习进行优化仍是主要挑战。一个根本难点在于单张图像可通过多种不同的脱盲序列生成,导致重要性比率往往难以计算。此外,现有方法倾向于忽略 dMLLMs 的分层生成过程,其中早期 token 定义全局布局,后期 token 聚焦局部细节。对所有 token 统一分配奖励的做法未能反映每个 token 对最终图像的实际贡献。为此,我们提出 Hierarchical Token GRPO (HT-GRPO),将该分层结构直接嵌入策略优化过程中。我们的做法包含 Sketch-Then-Paint 训练方案,将更新组织为三个 distinct 阶段:全局、结构和细化。我们还使用基于完全遮蔽状态的 prompt 条件化估计器计算重要性比率。此外,我们引入了分层信用分配机制,优先处理关键结构 token,以确保奖励的准确传递。使用两款流行的 dMLLM 主干模型 MMaDA 和 Lumina-DiMOO 进行实验,结果显示 HT-GRPO 在 GenEval 和 DPG 基准上实现了显著提升。六项额外指标的评估确认了在图像质量、美学和人类偏好方面的显著改进。

关键词

引用

@article{arxiv.2605.16842,
  title  = {Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models},
  author = {Siqi Luo and Jianghan Shen and Yi Xin and Huayu Zheng and Haoxing Chen and Yan Tai and Yue Li and Junjun He and Yihao Liu and Guangtao Zhai and Yuewen Cao and Xiaohong Liu},
  journal= {arXiv preprint arXiv:2605.16842},
  year   = {2026}
}