审阅、重掩码、精炼 (R3):面向文本生成的过程导向块扩散
计算与语言
2025-07-14 v1 机器学习
摘要
迭代文本生成的一个关键挑战在于使模型能够有效识别并纠正自身错误。我们提出了审阅、重掩码、精炼 (R3) 框架,该框架简洁且高效,无需额外模型训练,可应用于任何预训练的掩码文本扩散模型(如 LLaDA 或 BD3-LM)。在 R3 中,利用过程奖励模型 (PRM) 对中间生成的文本块进行审阅。随后,将这些 PRM 分数转化为重掩码策略:文本块的 PRM 分数越低(表明可能存在错误),该块中更多 token 会被重掩码。最后,模型被迫对这些受目标区域约束的文本进行精炼,从而集中资源针对性地改进前一次生成的次优部分,最终提升输出质量。
引用
@article{arxiv.2507.08018,
title = {Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation},
author = {Nikita Mounier and Parsa Idehpour},
journal= {arXiv preprint arXiv:2507.08018},
year = {2025}
}
备注
Accepted at Methods and Opportunities at Small Scale (MOSS), ICML 2025