中文

Sketch-and-Verify:通过程序草图实现结构化推理时间扩展

机器学习 2026-05-12 v1 人工智能 软件工程

摘要

SKETCHVERIFY 是一种同档次成本性能政策,而非通用的准确率提升。操作问题:拥有小型廉价代码模型(此处为 Gemini 3.1 Flash Lite)以延迟、部署或预算为原因的实践者,如何花费少量额外测试计算资源?SKETCHVERIFY 将搜索空间分解:LLM 枚举 K 个不同的算法策略,为每个策略编写程序草图(带 ?? 空洞的部分程序),并填充每个草图 M 次,产生 K x M 结构上多样的候选方案,通过执行进行验证并通过指纹聚类选择。每个额外的草图都保证探索不同的算法;每个额外的平面样本可能复制现有样本。我们的核心证据是 HumanEval+ 上三个 Gemini 档次(Lite、Flash、Pro)的成本-质量 Pareto 曲线,对 19 个 Lite 贪心失败问题的重新分析。两个发现:(1) 同档次内,草图在匹配候选数量时占优势。在困难子集上,Lite Sketch K=2, M=5 在 11/19(58%) 的问题上恢复,而平面 N=10 仅在 5/19(26%) 的问题上,提升 32pp;Lite Sketch K=10, M=10 在 15/19(79%) 的问题上恢复,而平面 N=100 仅在 10/19(53%) 的问题上,提升 26pp。即使在约3倍预算下,平面 N=50 仍落后于 Sketch K=2, M=5 11pp。(2) 跨档次,草图不会取代升级。Pro 贪心(89%) 在 Lite Sketch K=10, M=10(79%) 上在 pass@1 和美元成本上占据优势。实践者规则:如果可用更强档次,请在其上使用贪心;否则草图是花费额外计算资源的成本效益方式。我们通过 Flash Lite 扩展扫描报告 K 与 M 之间的权衡,报告 HumanEval+ 在 Flash 和 Pro 上的饱和情况,并展示该方法可与来自同时进行的语义投票系列工作的基于执行的选择相干地组合。

关键词

引用

@article{arxiv.2605.08658,
  title  = {Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching},
  author = {Shan Jiang and Zijian Yi and Chenguang Zhu},
  journal= {arXiv preprint arXiv:2605.08658},
  year   = {2026}
}