基于低维投影注意力的大规模语言模型高效可扩展训练
计算与语言
2024-11-05 v1 人工智能
机器学习
摘要
同时提高大规模语言模型(LLM)的有效性和效率是一个关键且具有挑战性的研究目标。在本文中,我们发现低秩预训练——通常被认为是在效率与性能之间存在妥协的高效方法——可以通过精确针对减少的参数实现可扩展的有效性。具体而言,仅将低维模块应用于注意力层——解决了这一问题并同时增强了有效性和效率。我们将此结构称为低维投影注意力(LPA),并提供了解释性分析。通过在 130M、370M 参数规模以及扩展到 3B 的大规模实验,我们验证了 LPA 的有效性和可扩展性。结果表明,与 vanilla Transformer 相比,LPA 模型可节省高达 12.4% 的时间,同时在测试困惑度(ppl)和下游任务上实现了约 5% 的提升。
引用
@article{arxiv.2411.02063,
title = {Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention},
author = {Xingtai Lv and Ning Ding and Kaiyan Zhang and Ermo Hua and Ganqu Cui and Bowen Zhou},
journal= {arXiv preprint arXiv:2411.02063},
year = {2024}
}
备注
Accepted to EMNLP 2024 (Main Conference)