语言模型“吸收”复制能力
计算与语言
2025-02-07 v2 人工智能
机器学习
摘要
我们关注语言模型的预训练动力学,特别是其从前文复制文本的能力——这是各种 LLM 应用(包括情境学习 ICL 和检索增强生成 RAG)的基本技能。我们提出一种新视角认为,基于 Transformer 的语言模型的复制能力类似于“吸收” (grokking),即模型在适应训练集后长期仍在测试集上突然实现泛化。我们的实验得出三个论点:(1) 预训练损失下降迅速,而模型的上下文复制能力最初滞后,然后突然饱和。(2) 复制能力的发展速度与训练的 token 数无关,类似于 grokking 速度不受数据集大小影响(只要数据分布保持不变)。(3) 复制负责的注意力头(induction heads)从浅层到深层形成,镜像了更深层电路在 grokking 期间的发展。我们认为,grokking 与上下文复制之间的联系可为更有效的语言模型训练提供有价值的见解,从而改善情境性能。例如,我们演示了正则化等增强 grokking 的技术,能够加速或增强上下文复制能力的发展。
引用
@article{arxiv.2409.09281,
title = {Language Models "Grok" to Copy},
author = {Ang Lv and Ruobing Xie and Xingwu Sun and Zhanhui Kang and Rui Yan},
journal= {arXiv preprint arXiv:2409.09281},
year = {2025}
}
备注
NAACL 2025 main conference, short paper