UnMaskFork:基于确定性动作分支的掩码扩散测试时扩展
机器学习
2026-02-05 v1 人工智能
摘要
测试时扩展策略已有效利用推理时计算量来增强自回归大型语言模型的推理能力。在本工作中,我们展示掩码扩散语言模型(MDLMs)本质上适合于高级搜索策略,由于其迭代和非自回归生成过程。为充分利用这一点,我们提出UnMaskFork(UMF),将解掩码轨迹建模为搜索树,并采用蒙特卡洛树搜索来优化生成路径。与标准扩展方法依赖随机抽样不同,UMF通过由多个MDLMs执行的确定性部分解掩码动作来探索搜索空间。我们的实证评估表明,UMF在复杂编码基准测试中 consistently 优于现有测试时扩展基线,同时在数学推理任务上也表现出强大的可扩展性。
引用
@article{arxiv.2602.04344,
title = {UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching},
author = {Kou Misaki and Takuya Akiba},
journal= {arXiv preprint arXiv:2602.04344},
year = {2026}
}