中文

In-context 学习的更广谱 spectrum

计算与语言 2025-06-06 v3 机器学习

摘要

语言模型能够从少量上下文示例中学习任务的能力引发了广泛关注。我们提供一种视角,将这种监督式少样本学习置于更广泛的元学习 in-context 学习 spectrum 中。事实上,我们认为,在上下文非平凡地降低后续预测损失的序列分布中,都可以解释为激发某种形式的 in-context 学习。我们认为,这种视角有助于统一语言模型所展现的广泛 in-context 能力——例如,从指令或角色扮演中适应任务,或对时间序列进行外推。这种视角还为 in-context 学习的潜在根源提供了线索,例如核心指代或平行结构的低级处理。最后,围绕 generalization 的重要性,这一视角提出了可以沿多个维度进行研究的可能性:不仅学习新事物的能力,还包括从不同呈现方式学习的灵活性,以及对所学内容的应用。我们讨论了与过往文献在元学习和目标条件主体中的更广泛联系,以及其他关于学习和适应的视角。我们通过建议研究 in-context 学习应考虑其更广泛的 in-context 能力和类型 generalization 的可能性来结束本文。

关键词

引用

@article{arxiv.2412.03782,
  title  = {The broader spectrum of in-context learning},
  author = {Andrew Kyle Lampinen and Stephanie C. Y. Chan and Aaditya K. Singh and Murray Shanahan},
  journal= {arXiv preprint arXiv:2412.03782},
  year   = {2025}
}