中文

Celo2:通往无学习优化自由午餐之路

机器学习 2026-02-24 v1 人工智能

摘要

学习型优化器是手工设计更新规则(如 Adam)的强大替代方案,但由于它们往往无法在训练分布之外实现 meta-generalization,且代价高昂,故实际应用中见效有限。例如, prior 工作 VeLO 将 meta-training 扩展至 4000 个 TPU 月(约相当于 GPT-3 计算能力的 10 倍),以 meta-train 一个通用学习型更新规则,但它在 600M 参数规模的任务上未能实现良好泛化。本文发现了一个意想不到的结果:通过构建简单的归一化优化器架构并增强 meta-training,便可在 VeLO 计算资源的极小比例(准确说是 4.5 个 GPU 小时)内 meta-train 一个高性能的通用学习型更新规则。我们的学习型更新规则能够稳定地扩展至千亿规模的 pretraining 任务(GPT-3 XL 1.3B),这是其 meta-training 分布规模的六个数量级。此外,它在多样化的 out-of-distribution 任务上表现出强性能,并与现代优化 harness 兼容,包括正交化、为输入输出权重和隐藏权重采用不同的更新规则,以及解耦权 decay。总之,本工作为可实用的可学习优化算法之路开辟了道路,释放了对更丰富 meta-training 和数据 curate 配方的探索潜力,以进一步提升性能。

关键词

引用

@article{arxiv.2602.19142,
  title  = {Celo2: Towards Learned Optimization Free Lunch},
  author = {Abhinav Moudgil and Boris Knyazev and Eugene Belilovsky},
  journal= {arXiv preprint arXiv:2602.19142},
  year   = {2026}
}

备注

ICLR 2026