WriteSAE:用于循环状态的稀疏自编码器
机器学习
2026-05-21 v4 人工智能
计算与语言
摘要
我们提出了 WriteSAE,这是一种用于循环语言模型状态中写入矩阵更新的稀疏自编码器。在 Gated DeltaNet、Mamba-2 和 RWKV-7 中,每个 token 都会写入一个形状为矩阵的更新到循环缓存中;残差流 SAE 具有向量形状的原子,无法直接替换该更新。WriteSAE 学习与模型自身写入相同形状的秩-1 矩阵原子。这使我们能够进行直接替换测试:在 SAE 激活某个原子的位置,我们删除模型的写入,将该原子按其 SAE 激活值比例插入,并继续前向传播。在 92.4% 评估的位置上,该原子比仅删除写入更接近最终 token 分布;平均每个原子而言,该率为 89.8%。对于 Gated DeltaNet,一个使用遗忘门、读查询和输出嵌入的公式预测结果对数变化,。相同的替换测试在 Mamba-2-370M 上达到 88.1%。在生成过程中,该公式选择写入方向;将其写入三个连续缓存位置且取模型写入范数的 可使最初由未修改模型排名 100--1000 的 token 在 100% 的续写中出现,原本仅为 33.3%。据我们了解,这是首个在状态空间或混合循环层中报告的缓存级干预。
引用
@article{arxiv.2605.12770,
title = {WriteSAE: Sparse Autoencoders for Recurrent State},
author = {Jack Young},
journal= {arXiv preprint arXiv:2605.12770},
year = {2026}
}
备注
26 pages, 14 figures, 21 tables; code at https://github.com/JackYoung27/writesae