MoVE:混合价值嵌入——扩容自回归模型参数记忆的新维度
机器学习
2026-02-02 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
自回归序列建模是现代生成式 AI 的基石,支撑着从文本生成到图像生成的多模态成果。然而,这一范式的根本性局限在于模型容量与计算成本的刚性结构耦合:传统上,扩大模型的参数记忆——其存储事实知识或视觉模式的仓库——需要加深或加宽网络结构,导致活跃 FLOPs 比例增长。本文引入 ,一种打破此耦合关系并为扩容建立新维度的机制。MoVE 通过引入全局可学习价值嵌入银行(跨所有注意力层共享),实现记忆与计算的解耦。对于序列中的每一步,模型运用可微软门控机制,动态混合来自该银行的检索概念融入标准价值投影。此架构允许参数记忆独立于网络深度进行扩容,仅需增加嵌入槽位数即可。我们通过严格控制的实验验证了 MoVE 在两个代表性自回归建模应用:文本生成和图像生成中的有效性。在两个领域中,MoVE 均优于标准及层级记忆基线,实现持续的性能提升,使能够构建“记忆稠密”模型,在相当于密集模型的计算预算下,获得更低的困惑度和更高的保真度。
引用
@article{arxiv.2601.22887,
title = {MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models},
author = {Yangyan Li},
journal= {arXiv preprint arXiv:2601.22887},
year = {2026}
}