Focused Transformer:用于上下文扩展的对比训练
计算与语言
2023-12-01 v2 人工智能
机器学习
摘要
大语言模型(LLM)具备以上下文方式整合新信息的卓越能力。然而,由于有效上下文长度的限制,这种方法的全部潜力常受制约。该问题的一个解决方案是赋予注意力层访问由(键,值)对组成的外部记忆的能力。然而,随着文档数量增加,相关键相对于无关键的比例下降,导致模型更关注无关键。我们识别出一项重大挑战,称为分心问题,即关联到不同语义值的键可能重叠,难以区分。为应对此问题,我们引入 Focused Transformer(FoT),一种采用受对比学习启发的训练过程的技术。该新颖方法增强了(键,值)空间的结构,使上下文长度得以扩展。我们的方法允许对已有的大规模模型进行微调以延长其有效上下文。这通过我们对 和 OpenLLaMA 检查点的微调得到证明。所得模型被命名为 LongLLaMA,在需要长上下文的任务中表现出进展。我们进一步说明,我们的 LongLLaMA 模型能熟练处理 上下文长度以进行密码检索(passkey retrieval)。
引用
@article{arxiv.2307.03170,
title = {Focused Transformer: Contrastive Training for Context Scaling},
author = {Szymon Tworkowski and Konrad Staniszewski and Mikołaj Pacek and Yuhuai Wu and Henryk Michalewski and Piotr Miłoś},
journal= {arXiv preprint arXiv:2307.03170},
year = {2023}
}
备注
Accepted at 37th Conference on Neural Information Processing Systems (NeurIPS 2023). 28 pages, 10 figures, 11 tables