时序感知特征选择:用于稳定稀疏自编码器训练的自适应时序掩码
机器学习
2025-10-13 v1 人工智能
计算与语言
摘要
理解大型语言模型的内部表征对确保其可靠性和安全性至关重要,稀疏自编码器(SAE)正逐渐成为一种有前景的可解释性方法。然而,当前的SAE训练方法面临特征吸收问题,即特征(或神经元)被吸收以最小化惩罚,导致难以持续识别和分析模型行为。我们引入自适应时序掩码(ATM)方法,通过跟踪激活幅度、频率和重构贡献来计算演化的时间依赖性重要性得分。ATM基于这些重要性得分的统计阈值应用概率掩码机制,实现更自然的特征选择过程。通过在Gemma-2-2b模型上进行大量实验,我们证明ATM在降低吸收得分方面显著优于现有方法,如TopK和JumpReLU SAE,同时保持优异的重构质量。这些结果表明ATM是学习稳定、可解释特征的原则性解决方案,为更可靠的模型分析提供了基础。
引用
@article{arxiv.2510.08855,
title = {Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training},
author = {T. Ed Li and Junyu Ren},
journal= {arXiv preprint arXiv:2510.08855},
year = {2025}
}
备注
First submitted on February 10th, 2025 to ICLR 2025 Workshop (XAI4Science: From Understanding Model Behavior to Discovering New Scientific Knowledge). The paper was accepted but the workshop does not generate proceedings. Now uploading to arXiv to make the paper publicly available