中文

上下文学习与奥卡姆剃刀

机器学习 2025-06-04 v4 人工智能

摘要

机器学习的核心目标是泛化。虽然“没有免费午餐定理”指出,在没有进一步假设的情况下,我们无法获得泛化的理论保证,但在实践中,我们观察到解释训练数据的简单模型泛化能力最好:这一原则被称为奥卡姆剃刀。尽管需要简单模型,但当前大多数机器学习方法仅最小化训练误差,并且至多通过正则化或架构设计间接地促进简单性。在这里,我们建立了奥卡姆剃刀与上下文学习之间的联系:上下文学习是某些序列模型(如Transformer)的一种涌现能力,能够在推理时从序列中的过去观察中学习。特别地,我们展示了用于训练上下文学习器的下一个词元预测损失直接等价于一种称为预序编码的数据压缩技术,并且最小化该损失相当于同时最小化训练误差和从上下文中隐式学习的模型的复杂度。我们的理论以及用于支持它的实证实验不仅提供了上下文学习的规范性解释,而且还阐明了当前上下文学习方法的缺点,提出了可以改进它们的方法。我们将代码发布在https://github.com/3rdCore/PrequentialCode。

关键词

引用

@article{arxiv.2410.14086,
  title  = {In-context learning and Occam's razor},
  author = {Eric Elmoznino and Tom Marty and Tejas Kasetty and Leo Gagnon and Sarthak Mittal and Mahan Fathi and Dhanya Sridhar and Guillaume Lajoie},
  journal= {arXiv preprint arXiv:2410.14086},
  year   = {2025}
}