中文

SAFR:用于解释性的神经元重新分配

机器学习 2025-02-12 v2 人工智能

摘要

叠加现象指的是在单个神经元中编码多个特征的表示,这在深度神经网络中很常见。该属性允许神经元组合和表示多个特征,使模型能够捕捉复杂信息并处理复杂任务。尽管性能前景光明,但模型的解释性却受到了削弱。本文提出了一种通过对特征叠加进行正则化来增强模型解释性的新方法。我们引入的SAFR simply applies regularizations to the loss function to promote monosemantic representations for important tokens while encouraging polysemanticity for correlated token pairs, where important tokens and correlated token pairs are identified via VMASK and attention weights respectively。我们在两个分类任务上对SAFR进行了评估。实验表明,SAFR在不损害预测性能的前提下,有效提高了模型的解释性。此外,SAFR通过可视化中间层的神经元分配提供了解释。

关键词

引用

@article{arxiv.2501.16374,
  title  = {SAFR: Neuron Redistribution for Interpretability},
  author = {Ruidi Chang and Chunyuan Deng and Hanjie Chen},
  journal= {arXiv preprint arXiv:2501.16374},
  year   = {2025}
}