中文

通过扩展测试时计算实现 IOI 金牌:开放权重模型的实践

机器学习 2026-04-16 v2 人工智能 计算与语言

摘要

竞争编程已成为评估大型语言模型 (LLM) 推理与问题解决能力的严格基准。国际信息学奥林匹克 (IOI) 是竞争编程中最著名的年度赛事之一,已成为比较人类与 AI 水平编程能力的关键基准。虽然多个专有模型被声称实现了 IOI 金牌水平,但往往未披露方法,而使用开放权重模型实现相当结果仍是重大挑战。本文我们提出 GenCluster,一个可扩展且可复现的测试时计算框架,能够使用开放权重模型实现 IOI 金牌水平。它结合大规模生成、行为聚类、排序和 round-robin 提交策略,在有限的验证预算下高效探索多样化的解空间。我们的实验表明,我们方法的性能随可用计算资源而一致扩展,缩小了开放系统与封闭系统之间的差距。值得注意的是,我们将展示 GenCluster 能够首次使用开放权重模型 gpt-oss-120b 在 IOI 2025 上获得金牌,为透明且可复现的 LLM 推理评估设立了新基准。

关键词

引用

@article{arxiv.2510.14232,
  title  = {Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models},
  author = {Mehrzad Samadi and Aleksander Ficek and Sean Narenthiran and Siddhartha Jain and Wasi Uddin Ahmad and Somshubra Majumdar and Vahid Noroozi and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2510.14232},
  year   = {2026}
}

备注

Accepted to ACL 2026