稀疏自编码器特征何为真实?Model-X Knockoff用于控制假发现率
机器学习
2025-11-18 v1
摘要
尽管稀疏自编码器(SAEs)在识别神经网络中可解释特征方面至关重要,但仍难以区分真实计算模式与错误相关性。我们引入Model-X Knockoff方法用于SAE特征选择,通过knockoff+方法在标准Model-X假设下(本例中通过对潜在分布的高斯代理)控制假发现率(FDR)。我们在分析512个高活性SAE潜变量用于情感分类后,以目标FDR q=0.1选取129个特征。约25%的潜变量携带任务相关信号,而75%不携带,这一选择组与未选取特征在knockoff统计量上显示出5.40倍的分离。我们的方法为通过结合SAEs与多重检验感知推断,提供一种可复现且原则化的可靠特征发现框架,推动了机制可解释性的基础。
引用
@article{arxiv.2511.11711,
title = {Which Sparse Autoencoder Features Are Real? Model-X Knockoffs for False Discovery Rate Control},
author = {Tsogt-Ochir Enkhbayar},
journal= {arXiv preprint arXiv:2511.11711},
year = {2025}
}
备注
1 figure