关联状态通用 Transformer:稀疏检索与结构化递归的结合
计算与语言
2026-04-30 v1 机器学习
摘要
我们研究结构化递归状态能否作为语言建模的紧凑关联主干,同时仍支持精确检索。我们引入了 UniMatrix,一个 Universal Transformer 风格的模型族,它在深度上复用共享的递归块,并用混合状态更新、ROSA 风格的残差路径和 token 条件化嵌入调制来增强它。我们在字节级 WikiText-2、合成关联召回、Apple MPS 上的吞吐量分析以及三重 token 交互的修正基准上评估这些模型。在小规模下,UniMatrix-Core 和 UniMatrix-ROSA 在 WikiText-2 上略优于参数匹配的 Transformer,同时使用的参数少得多,分别达到 5.084 和 5.083 bits-per-byte,而 Transformer 为 5.124。主要的负面结果同样重要:在关联召回上,原始 UniMatrix 族仍接近随机水平,而 Transformer 达到 25.4%,这表明仅靠压缩的递归状态不足以实现精确查找。面向检索的后续模型 UniMatrix-Assoc 仅略有帮助。相比之下,增加了稀疏槽路由和直接指针 logit 融合的 UniMatrix-SparsePointer 在原始试点配方上达到 75.6%,在无 dropout 的后续实验中达到 99.2%,同时参数比 Transformer 基线少 53.8%。消融实验表明,增益来自充足的槽容量和精确的指针级输出路由。总体而言,结构化递归状态有前景且参数高效,但强大的长程行为仍需要显式的稀疏检索和更好的内核。
引用
@article{arxiv.2604.25930,
title = {Associative-State Universal Transformers: Sparse Retrieval Meets Structured Recurrence},
author = {Liu Xiao},
journal= {arXiv preprint arXiv:2604.25930},
year = {2026}
}