离散扩散模型利用非对称性解决前瞻规划任务
机器学习
2026-02-24 v1
摘要
虽然 Autoregressive(AR)基于 Transformer 的生成式语言模型经常用于前瞻任务, 但最近的研究表明它们在执行需要多步前瞻的规划任务方面存在潜在差异。本工作我们调查在前瞻任务上训练 AR 与 Non-Autoregressive(NAR)模型, 例如离散扩散模型(dLLMs) 所产生的不同显现机制。通过要求模型提前规划以到达正确结论, 我们分析这两种范式在问题解决方式上的根本差异。我们识别出规划问题中的一个关键非对称性: 尽管前向生成在分支节点处需要复杂的前瞻, 但反向生成往往是确定性的。这种非对称性为 NAR 模型提供了机会。通过对训练和推理动力学的机制性分析, 我们展示了 NAR 模型通过利用 future tokens 反向解码来解决规划任务, 从而完全避免了学习复杂遍历机制的需求。因此, 我们报告了 AR 和 NAR 模型都能够在前瞻任务上实现完美准确率。然而, NAR 模型所需的训练样本数量呈指数级减少, 并且需要更浅的体系结构, 而 AR 模型通常在没有特定课程调整的情况下难以收敛。
引用
@article{arxiv.2602.19980,
title = {Discrete Diffusion Models Exploit Asymmetry to Solve Lookahead Planning Tasks},
author = {Itamar Trainin and Shauli Ravfogel and Omri Abend and Amir Feder},
journal= {arXiv preprint arXiv:2602.19980},
year = {2026}
}