中文

GQA:从多头检查点训练广义多查询Transformer模型

计算与语言 2023-12-27 v3 机器学习

摘要

多查询注意力(MQA)仅使用单个键值头,可大幅加速解码器推理。然而,MQA可能导致质量下降,并且仅为更快推理而训练一个单独模型可能并不可取。我们(1)提出了一种方法,使用原始预训练计算的5%将现有的多头语言模型检查点升级训练为具有MQA的模型;(2)引入了分组查询注意力(GQA),这是多查询注意力的一种推广,其使用中间数量(多于一个,少于查询头数量)的键值头。我们表明,升级训练的GQA达到了接近多头注意力的质量,同时具有与MQA相当的速度。

关键词

引用

@article{arxiv.2305.13245,
  title  = {GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints},
  author = {Joshua Ainslie and James Lee-Thorp and Michiel de Jong and Yury Zemlyanskiy and Federico Lebrón and Sumit Sanghai},
  journal= {arXiv preprint arXiv:2305.13245},
  year   = {2023}
}

备注

Accepted at EMNLP 2023. Added to related work