大规模推理模型下的竞赛编程
机器学习
2025-07-15 v4 人工智能
计算与语言
摘要
我们表明,将强化学习应用于大语言模型(LLM)可显著提升复杂编码和推理任务的性能。此外,我们比较两种通用推理模型——OpenAI o1 和 o3 的早期检查点——与特定于领域的系统 o1-ioi 后者使用为参加 2024 年国际计算机挑战赛(IOI)设计的手工推理策略。我们在 IOI 2024 现场竞赛中使用 o1-ioi,并通过手工构建的测试时策略,获得了第 49 百分位的成绩。在放宽竞赛约束条件下,o1-ioi 实现了金牌成绩。然而,在评估后期模型如 o3 时,我们发现 o3 在无需手工构建的特定领域策略或放宽约束条件的情况下即可获得金牌。我们的发现表明,尽管特定管道如 o1-ioi 可实现稳健的改进,但规模更大的通用 o3 模型在不依赖手工推理启发式方法的情况下超越了这些结果。值得注意的是,o3 在 2024 年 IOI 中获得金牌,并在 Codeforces 上获得与精英人类竞技者持平的评级。总体而言,这些结果表明,规模化的通用强化学习而非依赖特定技术,为在推理领域(如竞赛编程)实现最先进技术提供了稳健的路径。
关键词
引用
@article{arxiv.2502.06806,
title = {Logits are All We Need to Adapt Closed Models},
author = {Gaurush Hiranandani and Haolun Wu and Subhojyoti Mukherjee and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2502.06806},
year = {2025}
}
备注
29 pages, 8 figures