低秩适配稀疏自编码器
机器学习
2025-05-28 v2
摘要
稀疏自编码器(SAE)将语言模型表示分解为稀疏的线性潜在向量。近期研究通过利用语言模型梯度改进了SAE,但训练期间需进行大量昂贵的反向传播,且当SAE重构被插入模型中时仍会显著增加交叉熵损失。本文采用根本性不同的方法:利用低秩适应(LoRA)对在已训练SAE基础上微调的语言模型本身进行调整。我们在Gemma Scope系列SAE上,对SAE稀疏性、宽度、语言模型规模、LoRA秩以及模型层数进行分析。实验结果表明,在前向传播插入SAE时,我们的方法可将交叉熵损失差距降低30%至55%。此外,与端到端(e2e)SAE相比,我们的方法在Gemma上实现相同下游交叉熵损失所需时间缩短3倍至20倍,在Llama上缩短2倍至10倍。我们进一步表明该技术改进了下游指标,能够同时适配多个SAE且不损害通用语言模型能力。结果表明,提高模型可解释性不仅限于后处理SAE训练;通过直接优化模型本身也可实现帕累托改进。
引用
@article{arxiv.2501.19406,
title = {Low-Rank Adapting Models for Sparse Autoencoders},
author = {Matthew Chen and Joshua Engels and Max Tegmark},
journal= {arXiv preprint arXiv:2501.19406},
year = {2025}
}
备注
Code available at https://github.com/matchten/LoRA-Models-for-SAEs