Scavenging Hyena:将 Transformer 蒸馏为长卷积模型
计算与语言
2024-02-01 v1 机器学习
摘要
以 GPT-4 等架构为代表的大语言模型 (LLM) 的快速发展,重塑了自然语言处理的格局。本文引入了一种开创性的方法来解决与 LLM 预训练相关的效率问题,提出使用知识蒸馏进行跨架构迁移。利用来自高效 Hyena 机制的见解,我们的方法将 Transformer 模型中的注意力头替换为 Hyena,提供了一种传统预训练的廉价替代方案,同时应对了二次注意力机制中固有的处理长上下文信息的挑战。与传统的以压缩为重点的方法不同,我们的技术不仅提高了推理速度,而且在准确性和效率上都超越了预训练。在不断演进的 LLM 时代,我们的工作有助于追求可持续的人工智能解决方案,在计算能力与环境影响之间取得平衡。
关键词
引用
@article{arxiv.2401.17574,
title = {Scavenging Hyena: Distilling Transformers into Long Convolution Models},
author = {Tokiniaina Raharison Ralambomihanta and Shahrad Mohammadzadeh and Mohammad Sami Nur Islam and Wassim Jabbour and Laurence Liang},
journal= {arXiv preprint arXiv:2401.17574},
year = {2024}
}
备注
9 pages, 2 figures