中文

无跳跃Transformer仅需KV权重

机器学习 2025-10-28 v2

摘要

He和Hofmann (arXiv:2311.01906) 详细描述了一种无跳跃Transformer,它去掉了V和P(注意力后投影)线性层,从而减少了总权重数量。然而,该方案仅适用于多头注意力(MHA),不适用于多查询注意力(MQA)和分组查询注意力(GQA)。后者被许多流行的LLM使用,如Llama 2、Mistral、Mixtral、PaLM和Gemma。因此,这篇微论文提出了适用于MQA和GQA的数学等价版本。例如,从Mistral-7B的无跳跃版本中移除Q和P将移除其15%的权重(从而降低其计算和内存复杂度)。观看我们的解释视频https://youtu.be/Tx_lMpphd2g,并访问https://github.com/OpenMachine-ai/transformer-tricks获取代码和更多Transformer技巧。

关键词

引用

@article{arxiv.2404.12362,
  title  = {KV-weights are all you need for skipless transformers},
  author = {Nils Graef},
  journal= {arXiv preprint arXiv:2404.12362},
  year   = {2025}
}

备注

6 pages, 4 figures