打破KV缓存瓶颈:Fan Duality Model实现O(1)解码内存并具备优异的关联记忆
摘要
我们提出FDM(Fan Duality Model),一种线性序列架构,解决序列建模中记忆效率与关联记忆之间的根本矛盾。FDM将序列处理分为两个组件:波动组件(通过保持相位的Givens旋转实现的循环扫描)将长程模式压缩到固定大小的复隐藏状态中;粒子组件(局部-全局缓存)通过学习的关联寻址检索特定标记。前者独立于序列长度N,具有严格的O(1)解码内存:在128-8,192个标记的所有提示长度下均为867 MB固定,相对于Transformer的853-4,247 MB(在N=8,192时降低4.9倍)。除了该架构外,我们发现波动组件和粒子组件联合训练会导致次优收敛。我们提出Freeze-Scan(冻结扫描)两种阶段的训练策略,冻结循环扫描并联合优化缓存与嵌入,实现在WikiText-103上的PPL=64.9(在44K步完成),相较于完全微调(PPL=487)提升7.5倍。在多查询关联记忆(MQAR)上,FDM实现0.966的准确率,超越Transformer(0.606)59.5%,而仅使用扫描组件的纯模型得分仅为0.011,确认了粒子组件的必要性。最后,我们引入全息参考束解码, 将当前输入作为参考束来调制,可将PPL降低最高2.13点(PPL=62.79),仅需1.3M的额外参数即可实现4头正交参考束,为全息解释提供了实证支持。代码和预训练权重: https://github.com/YasongFan/FDM
关键词
引用
@article{arxiv.2604.07716,
title = {Breaking the KV Cache Bottleneck: Fan Duality Model Achieves O(1) Decode Memory with Superior Associative Recall},
author = {Yasong Fan},
journal= {arXiv preprint arXiv:2604.07716},
year = {2026}
}
备注
v2: Major update. Introduced the Fan Duality Model (FDM) architecture, achieving O(1) decode memory and exact associative recall. Added holographic decoding ablation studies