T$^\star$:基于轨迹感知强化学习的掩码扩散语言模型逐步块尺度扩展
计算与语言
2026-03-30 v4
摘要
我们提出T,一种基于 TraceRL 的简单训练课程,用于掩码扩散语言模型(MDMs)中逐步块尺度扩展。从 AR 初始化的小块 MDM 开始,T 平滑过渡到更大的块,从而在数学推理基准测试中实现更高的并行解码并保持最小性能下降。此外,进一步分析表明,T 实际上可能收敛到一种替代解码方案,实现相当的性能。
引用
@article{arxiv.2601.11214,
title = {T$^\star$: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning},
author = {Hanchen Xia and Baoyou Chen and Yutang Ge and Guojiang Zhao and Siyu Zhu},
journal= {arXiv preprint arXiv:2601.11214},
year = {2026}
}