GoldFinch:高性能 RWKV/Transformer 混合模型,具线性预填充和极端 KV 缓存压缩
计算与语言
2024-07-18 v1 人工智能
摘要
我们介绍 GoldFinch,这是一种混合线性注意力/Transformer 序列模型,使用新技术在时间和空间复杂度均为序列长度的线性时间和空间复杂度内高效生成高度压缩且可重复使用的 KV 缓存。GoldFinch 将我们的新 GOLD transformer stacked 在增强版 Finch (RWKV-6) 架构之上。我们训练了最高达 15 亿参数的 Finch、Llama 和 GoldFinch 架构 class 模型,发现它们相对于 Finch 和 Llama 具有显着改进的建模性能。我们的缓存大小节省随模型层数线性增长,范围从 756 倍到 2550 倍小于传统 transformer 缓存,使即使在有限硬件资源上也能推理极大的上下文长度。虽然自回归生成由于注意力机制每个 token 的时间复杂度为 O(n),但由于使用循环神经网络 (RNN) 生成整个初始缓存状态的预填充计算,提交的上下文每个 token 的预填充计算仅需 O(1) 时间。我们在 Apache 2.0 许可证下发布我们的训练好的权重和训练代码供社区使用。
关键词
引用
@article{arxiv.2407.12077,
title = {GoldFinch: High Performance RWKV/Transformer Hybrid with Linear Pre-Fill and Extreme KV-Cache Compression},
author = {Daniel Goldstein and Fares Obeid and Eric Alcaide and Guangyu Song and Eugene Cheah},
journal= {arXiv preprint arXiv:2407.12077},
year = {2024}
}