GQA:从多头检查点训练广义多查询Transformer模型
计算与语言
2023-12-27 v3 机器学习
摘要
多查询注意力(MQA)仅使用单个键值头,可大幅加速解码器推理。然而,MQA可能导致质量下降,并且仅为更快推理而训练一个单独模型可能并不可取。我们(1)提出了一种方法,使用原始预训练计算的5%将现有的多头语言模型检查点升级训练为具有MQA的模型;(2)引入了分组查询注意力(GQA),这是多查询注意力的一种推广,其使用中间数量(多于一个,少于查询头数量)的键值头。我们表明,升级训练的GQA达到了接近多头注意力的质量,同时具有与MQA相当的速度。
引用
@article{arxiv.2305.13245,
title = {GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints},
author = {Joshua Ainslie and James Lee-Thorp and Michiel de Jong and Yury Zemlyanskiy and Federico Lebrón and Sumit Sanghai},
journal= {arXiv preprint arXiv:2305.13245},
year = {2023}
}
备注
Accepted at EMNLP 2023. Added to related work