中文

变压器在回溯搜索中能否学习验证?

机器学习 2026-05-22 v1 人工智能 计算机科学中的逻辑

摘要

回溯搜索是经典约束求解器、规划器和定理证明器的基础。近期的基于变压器的推理系统在其自身中间步骤的搜索树上进行搜索。常见的训练配方是在离线求解器轨迹上拟合自回归 next-token 损失。模型在每一步的输入是所有先前决策的累积轨迹。最优的继续或回溯预测器只取决于当前搜索状态,因为两个到达相同状态的轨迹都 admit 相同的可行继续方案。我们展示,针对累积轨迹训练的解码器-only 变压器未能满足这一要求,方式有两种:轨迹可以跨越多个位置 (scattered retrieval),并且预测器可以基于轨迹而非状态进行条件化 (history entanglement)。我们通过局部化 (localization) 解决 scattered retrieval,这是一种针对轨迹级别的修复方法,将每个决策块重写以暴露局部状态特征。我们通过选择性状态注意 (Selective State Attention, SSA) 解决 history entanglement,这是一种固定注意力掩码,结构性地强制基于状态的决策,而无需修改训练数据、目标或参数。我们关注的是在传播暴露矛盾后进行的反应式验证。在 3-SAT、图着色、积木世界和回溯解析上测试 SSA。在仅在先前历史不同但相同状态的情形下,SSA 发出相同的决策,而累积训练的因果基线则不然。我们的贡献是对序列化轨迹数据上变压器行为的诊断,配合一种结构性修复方法。可能在自身推理步骤上搜索的预训练语言模型可能面临相同的失败。我们的分析为在不重新训练的情况下应用相同隔离的推理时上下文清除打开了可能性。

关键词

引用

@article{arxiv.2605.22221,
  title  = {Can Transformers Learn to Verify During Backtracking Search?},
  author = {Yin Jun Phua and Tony Ribeiro and Tuan Nguyen and Katsumi Inoue},
  journal= {arXiv preprint arXiv:2605.22221},
  year   = {2026}
}