中文

专精于泛化之后:探索基础模型测试时间训练的机制

机器学习 2026-02-10 v4 人工智能

摘要

最近的实证研究探索了在给定任务的测试时间继续训练的想法,称为测试时间训练(TTT),并发现其可显著提升性能。然而,关于何时以及为何有效存在有限的理解。早期的解释主要聚焦于观察到 TTT 在应用于分布外适应或搭配特权数据时可能有效。然而,随着基础模型规模的不断增长,大多数测试数据仍属于分布内,这些解释提出了质疑。我们另辟蹊径,认为基础模型仍全球性地存在参数不足,TTT 提供了在泛化之后进行专精的机制,聚焦于测试任务相关概念的容量。具体而言,基于线性表示假设,我们提出的模型在进行全局训练后,TTT 可实现显著更小的分布内测试误差。我们通过在 ImageNet 上训练稀疏自编码器来实证验证模型的关键假设,表明语义相关数据点仅由少数共享概念解释。最后,我们在图像和语言任务上进行了规模化研究,确认了我们模型的实际意义,确定了专精最为有效的 regime。

关键词

引用

@article{arxiv.2509.24510,
  title  = {Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models},
  author = {Jonas Hübotter and Patrik Wolf and Alexander Shevchenko and Dennis Jüni and Andreas Krause and Gil Kur},
  journal= {arXiv preprint arXiv:2509.24510},
  year   = {2026}
}

备注

ICLR 2026 Oral at CCFM @ NeurIPS 2025