ANCORA:通过流形锚定自博弈学习提问以实现可验证推理
机器学习
2026-05-08 v2 人工智能
编程语言
摘要
我们提出向开放式课程自博弈的范式转变:统一策略不是学习在固定提示集上回答,而是学习提问:生成可验证问题,解决它们,并将验证器反馈转化为无需人工标注解决方案的自我改进。我们引入了 ANCORA,其中策略在生成新颖规范的提议者和产生已验证解决方案的求解器之间交替,并由三个关键机制锚定:一个两级组相对更新,将提议者在规范上的优势与求解者在解决方案尝试上的优势耦合;迭代自蒸馏 SFT,在 RL 之前将基模型投影到其有效输出流形上;以及一个 UCB 引导的课程 DAG,其策略诱导的问题集在自组合下可证明地扩展。没有这些稳定器,即使在 MLRL 对齐的奖励下,稀疏的验证器反馈也会导致提议者崩溃;有了它们,ANCORA 从零人工解决方案引导出一个可验证的课程。在 Verus 中实例化,ANCORA 将 Dafny2Verus 的 pass@1 从 26.6% 的 SFT 基线提升至测试时训练(TTT,0-shot)中的 81.5%,尽管 PSV 是 1-shot 推理,但仍比 PSV 自博弈高出 15.8 个百分点;在迁移设置中,从 Dafny2Verus 种子训练,在保留的 MBPP 和 HumanEval 上分别获得 36.2% 和 17.2% 的 pass@1。
引用
@article{arxiv.2604.27644,
title = {ANCORA: Learning to Question via Manifold-Anchored Self-Play for Verifiable Reasoning},
author = {Chengcao Yang},
journal= {arXiv preprint arXiv:2604.27644},
year = {2026}
}
备注
v2: Updated abstract; strengthened the proof of Proposition 4.1; corrected minor typos; corrected author list