中文

LightningRL:通过强化学习突破块状 dLLM 的精度-并行性权衡

机器学习 2026-03-17 v1

摘要

扩散大型语言模型(dLLM)因其并行标记生成而成为一种有前景的范式,块状变体因此引起了广泛关注。尽管具有潜力,但现有的dLLM通常存在 rigid accuracy-parallelism trade-off:通过激进的并行解码增加每个前向的标记数(TPF),常导致性能下降和生成不稳定。我们识别出这一限制源于模型无法导航高并行性场景,在此场景下,近似误差和局部损坏会累积,最终削弱并行生成的可靠性。为此,我们提出LightningRL,一种旨在直接优化预训练dLLM速度-质量 Pareto 前沿的后训练框架。不同于强制统一并行化,本方法利用强化学习识别并强化保持生成准确性的高并行性轨迹。基于Group Relative Policy Optimization(GRPO)框架,LightningRL引入若干为dLLM量身定制的增强措施:(1)通过 per-reward 解耦归一化实现训练稳定;(2)对正确轨迹上的标记级负对数似然(NLL)正则化以锚定模型性能;(3)采用TPF感知的筛选以提升训练效率。跨多个数学和编码基准的实验结果表明,LightningRL持续推进Pareto前沿,在显著提高并行性的同时保持竞争的任务准确性,平均TPF达到7.32(在MBPP数据集上最高达11.10)。我们的代码已公开发布于https://github.com/SJTU-DENG-Lab/LightningRL。

关键词

引用

@article{arxiv.2603.13319,
  title  = {LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning},
  author = {Yanzhe Hu and Yijie Jin and Pengfei Liu and Kai Yu and Zhijie Deng},
  journal= {arXiv preprint arXiv:2603.13319},
  year   = {2026}
}