Laughing Hyena Distillery:从卷积中提取紧凑递归
机器学习
2023-10-31 v1 人工智能
信号处理
摘要
近期无注意力序列模型的进展依赖卷积作为Transformer核心注意力算子的替代。特别地,长卷积序列模型已在许多领域取得SOTA性能,但在自回归推理负载中代价显著——朴素地需要对每个生成令牌完整遍历(或缓存激活)输入序列——与基于注意力的模型类似。本文致力于使任意预训练长卷积架构中每令牌的计算与内存代价为 ,以降低生成时的内存占用并提升吞吐。具体而言,我们的方法包括从每个卷积层提取低维线性状态空间模型,建立在有理插值法与模型降阶技术之上。我们进一步引入对基于卷积的层(如Hyena)的架构改进:通过将跨通道的滤波器按头绑定(weight-tying),我们实现了更高的预训练质量并减少了需蒸馏的滤波器数量。所得模型在1.3B参数下取得比Transformer高10倍、比Hyena高1.5倍的吞吐,且蒸馏后质量无任何损失。
引用
@article{arxiv.2310.18780,
title = {Laughing Hyena Distillery: Extracting Compact Recurrences From Convolutions},
author = {Stefano Massaroli and Michael Poli and Daniel Y. Fu and Hermann Kumbong and Rom N. Parnichkun and Aman Timalsina and David W. Romero and Quinn McIntyre and Beidi Chen and Atri Rudra and Ce Zhang and Christopher Re and Stefano Ermon and Yoshua Bengio},
journal= {arXiv preprint arXiv:2310.18780},
year = {2023}
}