GQKVA:通过分组查询、键与值实现 Transformer 高效预训练
机器学习
2025-05-27 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
大规模基于 transformer 的模型面临若干挑战,包括预训练缓慢且计算密集,以及过度参数化。本文通过提出一种称为 GQKVA 的通用方法来应对这些挑战,该方法推广了查询、键和值分组技术。GQKVA 旨在加速 transformer 预训练,同时缩减模型规模。我们对多种 GQKVA 变体的实验凸显了性能与模型规模之间的明确权衡,从而可根据资源和时间限制进行定制化选择。我们的发现还表明,常规的多头注意力方法并非总是最佳选择,因为存在更轻量、更快速的替代方案。我们在 ViT 上测试了该方法,在图像分类任务中准确率提升约 0.3%,同时模型规模缩减约 4%。此外,我们最激进的模型缩减实验使模型规模减小约 15%,而准确率仅下降约 1%。
引用
@article{arxiv.2311.03426,
title = {GQKVA: Efficient Pre-training of Transformers by Grouping Queries, Keys, and Values},
author = {Farnoosh Javadi and Walid Ahmed and Habib Hajimolahoseini and Foozhan Ataiefard and Mohammad Hassanpour and Saina Asani and Austin Wen and Omar Mohamed Awad and Kangling Liu and Yang Liu},
journal= {arXiv preprint arXiv:2311.03426},
year = {2025}
}