中文

Block-R1:重新思考多领域强化学习中块大小对扩散大语言模型的作用

机器学习 2026-05-14 v2

摘要

近年来,强化学习(RL)被广泛应用于扩散大语言模型(dLLMs)的后训练阶段,以通过分块半自回归生成来增强推理能力。因此,块大小已成为 dLLMs 中的一个关键因素,因为它决定了并行解码的粒度,并影响 RL 优化(例如 GRPO)过程中的 rollout 轨迹。与以往在推理阶段针对单一领域研究块大小的影响不同,本文从领域冲突的角度出发,研究多领域场景下 dLLM RL 后训练中的块大小问题。主要贡献如下:(1)形式化定义了多领域 RL 中 dLLMs 的领域块大小冲突,该冲突将极大影响基于 rollout 的 RL 方法的后训练效果;(2)构建了一个新颖的数据集 Block-R1-41K,为每个样本提供了最佳改进的训练块大小,并由此引入块大小冲突分数以定量衡量领域冲突;(3)提出了一个新的基准 Block-R1,用于在单领域和跨领域场景下进行灵活的 dLLM RL 后训练;(4)提出了一种简单而强大的跨领域后训练方法,该方法采用样本级的最佳改进训练块大小。Block-R1 基准全面涵盖了在 13 个不同数据集、7 种最新 RL 算法和多种 dLLM 骨干网络上的大量实验。该基准已在 https://github.com/YanJiangJerry/Block-R1 开源,数据集在 https://huggingface.co/datasets/YanJiangJerry/Block-R1-41K 发布。

关键词

引用

@article{arxiv.2605.11726,
  title  = {Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models},
  author = {Yan Jiang and Ruihong Qiu and Zi Huang},
  journal= {arXiv preprint arXiv:2605.11726},
  year   = {2026}
}