中文

超越顶级激活:自动化可解释性的高效可靠众包评估

计算机视觉与模式识别 2025-12-04 v2 机器学习

摘要

解释单个神经元或激活空间中的方向是机械可解释性中的重要议题。已提出许多自动化可解释性方法以生成此类解释,但这些解释的可靠性仍不清楚,哪些方法产生最准确的描述也不明确。虽然众包评估常被使用,但现有管道噪声大、成本高,通常仅评估最高激活的输入,导致结果不可靠。本文引入两种技术,以启用成本效益高且准确的众包评估自动化可解释性方法,超越顶级激活输入。首先,我们提出模型导向重要性抽样 (Model-Guided Importance Sampling, MG-IS) 以选择最具信息量的输入供人类评审者查看。我们的实验表明,这一方法可将达到相同评估准确性所需的输入数量降低约13倍。其次,我们通过贝叶斯评级聚合 (Bayesian Rating Aggregation, BRAgg) 解决众包评级中的标签噪声问题,该方法使我们能够将每个输入所需的评级数量降低约3倍,以克服噪声。此外,这些技术使评估成本降低约40倍,使大规模评估变得可行。最后,我们使用这些方法对近期自动化可解释性方法进行大规模众包研究,这些方法针对视觉网络。

关键词

引用

@article{arxiv.2506.07985,
  title  = {Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability},
  author = {Tuomas Oikarinen and Ge Yan and Akshay Kulkarni and Tsui-Wei Weng},
  journal= {arXiv preprint arXiv:2506.07985},
  year   = {2025}
}