学生指导教师:通过谱正交探索实现弱到强推断
人工智能
2026-04-30 v2
摘要
大型语言模型(LLM)在针对具有挑战性的数学推理任务时常常出现“推理坍塌”,即随机抽样产生相同错误逻辑的词汇变体,而非真正的语义探索。我们观察到,失败的推理痕迹常与模型隐藏状态几何中的低秩偏见流形相关联,这会降低对纠正解答方向的探索。为此,我们提出谱正交探索(SOE),这是一种在“学生指导教师”范式下的几何推理框架。与使用弱辅助智能体进行模仿不同,SOE 将其用作正交探针,将语义上异构的推理信号引入教师的主导子空间的正交补中。这种干预将引导教师走向更具多样性的推理轨迹,并提高探索超出标准抽样。在数学基准测试上,SOE 将平均准确率提高了 62.4%,将平均抽样效率提高了 113.7%,超过基线方法,这表明几何干预对于缓解数学推理中的推理坍塌是有效的。我们进一步提供了 SOE 在逻辑和代码生成基准测试上的有效性的初步证据。
引用
@article{arxiv.2601.06160,
title = {Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration},
author = {Dayu Wang and Jiaye Yang and Weikang Li and Jiahui Liang and Yang Li and Deguo Xia and Jizhou Huang},
journal= {arXiv preprint arXiv:2601.06160},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference