中文

通过组合实现分布外泛化:Transformer 中归纳头的视角

计算与语言 2024-12-31 v2 人工智能 机器学习 机器学习

摘要

GPT-4 等大型语言模型(LLM)有时表现出创造性,能够通过提示中的少量示例解决新任务。这些任务要求模型在与训练数据不同的分布上进行泛化——这被称为分布外(OOD)泛化。尽管 LLM 取得了巨大成功,但它们如何实现 OOD 泛化仍然是一个开放且未被充分探索的问题。我们研究了实例根据隐藏规则生成的场景下的 OOD 泛化,包括带有符号推理的上下文学习。模型需要在不进行任何微调的情况下推断输入提示背后的隐藏规则。我们实证研究了 Transformer 在合成示例上的训练动力学,并在多种预训练 LLM 上进行了广泛实验,重点关注一种称为归纳头的组件。我们发现 OOD 泛化与组合密切相关——模型可以通过组合两个自注意力层来学习规则,从而实现 OOD 泛化。此外,嵌入(或特征)空间中的共享潜在子空间充当组合的桥梁,通过对早期层和后期层进行对齐,我们称之为公共桥接表示假设。

关键词

引用

@article{arxiv.2408.09503,
  title  = {Out-of-distribution generalization via composition: a lens through induction heads in Transformers},
  author = {Jiajun Song and Zhuoyan Xu and Yiqiao Zhong},
  journal= {arXiv preprint arXiv:2408.09503},
  year   = {2024}
}

备注

46 pages, 27 figures