中文

超越可解释性:特征单义性对模型鲁棒性的增益

机器学习 2024-10-30 v1 人工智能

摘要

深度学习模型常因多义性而缺乏可解释性,即单个神经元被多个不相关的语义激活,导致模型行为归因不清。单义性(即神经元对应一致且独特的语义)的最新进展显著提高了可解释性,但通常被认为会损害准确性。在这项工作中,我们挑战了准确性-可解释性权衡这一普遍信念,表明单义性特征不仅能增强可解释性,还能带来模型性能的具体增益。在包括输入和标签噪声、小样本学习和域外泛化在内的多个鲁棒学习场景中,我们的结果表明,利用单义性特征的模型显著优于依赖多义性特征的模型。此外,我们对特征单义性带来的鲁棒性增益提供了实证和理论上的理解。我们的初步分析表明,单义性通过促进特征表示的更好分离,从而产生更鲁棒的决策边界。这一多样化的证据凸显了单义性在提升模型鲁棒性方面的普遍性。作为这个新方向的第一步,我们开始探索单义性在可解释性之外的学习益处,为连接可解释性与鲁棒性的长期假设提供了支持。代码可在 \url{https://github.com/PKU-ML/Beyond_Interpretability} 获取。

关键词

引用

@article{arxiv.2410.21331,
  title  = {Beyond Interpretability: The Gains of Feature Monosemanticity on Model Robustness},
  author = {Qi Zhang and Yifei Wang and Jingyi Cui and Xiang Pan and Qi Lei and Stefanie Jegelka and Yisen Wang},
  journal= {arXiv preprint arXiv:2410.21331},
  year   = {2024}
}