中文

VFScale: 基于无验证器的可验证测试时间可扩展扩散模型进行内在推理

机器学习 2026-02-09 v5

摘要

受人类 SYSTEM 2 思维启发, 大语言模型 (LLM) 通过扩展链式思维在复杂推理任务中表现出色. 然而, 对扩散模型的类似测试时间扩展在复杂推理方面仍鲜有探索. 从现有工作来看, 在此设置下存在两个主要挑战: (i) 依赖外部验证器, 这在没有任何外部反馈的情况下与人类智力的内在推理存在显著差距, 以及 (ii) 缺乏有效的搜索算法. 本文引入无验证器可验证测试时间可扩展扩散模型 (VFScale) 以实现可扩展的内在推理, 其将数量-样本测试时间扩展与扩散模型的内在能量函数作为验证器相结合. 具体而言, VFScale 包含两个关键创新以解决上述挑战. 在训练方面, VFScale 包括一种新的 MRNCL loss 和 KL 正则化以改善能量景观, 确保所学能量函数本身作为可靠验证器. 在推理方面, VFScale 将降噪过程与一种新的混合蒙特卡洛树搜索 (hMCTS) 集成以提高搜索效率. 在迷宫和数独等具有挑战性的推理任务上, 我们展示了 VFScale 训练目标和可扩展推理方法的有效性. 特别是, 我们的 VFScale 在最多 6×66\times6 的迷宫大小下训练, 即可解决 88% 的 15×1515\times15 规模更大迷宫问题, 而标准扩散模型则完全失败. 代码可在 https://github.com/AI4Science-WestlakeU/VFScale 查找.

关键词

引用

@article{arxiv.2502.01989,
  title  = {VFScale: Intrinsic Reasoning through Verifier-Free Test-time Scalable Diffusion Model},
  author = {Tao Zhang and Jia-Shu Pan and Ruiqi Feng and Tailin Wu},
  journal= {arXiv preprint arXiv:2502.01989},
  year   = {2026}
}

备注

ICLR 2026. 30 pages, 13 figures