在测试时学习发现
机器学习
2026-02-06 v2 人工智能
摘要
我们如何利用 AI 为一个科学问题发现新的最优水平?先前的测试时缩放工作,如 AlphaEvolve,通过提示一个冻结的大语言模型(LLM)来执行搜索。我们在测试时执行强化学习,使得 LLM 可以继续训练,但此时使用的是特定于该测试问题的经验。这种形式的持续学习非常特殊,因为其目标是产生一个优秀的解决方案,而不是平均意义上的多个好方案,并且是解决这个特定问题,而不是泛化到其他问题。因此,我们的学习目标和搜索子程序被设计为优先考虑最有希望的解决方案。我们将此方法称为测试时训练以发现(TTT-Discover)。遵循先前的工作,我们专注于具有连续奖励的问题。我们报告了所尝试的每一个问题的结果,涵盖数学、GPU 内核工程、算法设计和生物学。TTT-Discover 在几乎所有这些问题上都设立了新的最优水平:(i)Erdős 最小重叠问题和一个自相关不等式;(ii)一个 GPUMode 内核竞赛(比先前技术快高达 );(iii)过去的 AtCoder 算法竞赛;以及(iv)单细胞分析中的去噪问题。我们的解决方案经过了专家或组织者的评审。我们所有的结果都是使用一个开放模型 OpenAI gpt-oss-120b 取得的,并且可以通过我们公开的代码复现,这与之前需要闭源前沿模型的最佳结果形成对比。我们的测试时训练运行通过 Thinking Machines 的 API Tinker 执行,每个问题的成本仅为几百美元。
引用
@article{arxiv.2601.16175,
title = {Learning to Discover at Test Time},
author = {Mert Yuksekgonul and Daniel Koceja and Xinhao Li and Federico Bianchi and Jed McCaleb and Xiaolong Wang and Jan Kautz and Yejin Choi and James Zou and Carlos Guestrin and Yu Sun},
journal= {arXiv preprint arXiv:2601.16175},
year = {2026}
}
备注
Code: https://github.com/test-time-training/discover