用语言模型解释深度视觉网络中的神经元
计算机视觉与模式识别
2025-02-20 v2 机器学习
摘要
在本文中,我们提出了Describe-and-Dissect(DnD),一种描述视觉网络中隐藏神经元角色的新方法。DnD利用多模态深度学习的最新进展来生成复杂的自然语言描述,无需标记训练数据或预定义的概念集。此外,DnD无需训练,这意味着我们不训练任何新模型,并且将来可以轻松利用能力更强的通用模型。我们进行了广泛的定性和定量分析,表明DnD通过提供更高质量的神经元描述,优于先前的工作。具体来说,我们的方法平均提供最高质量的标签,并且被选为神经元最佳解释的可能性是最好基线的2倍以上。最后,我们展示了一个用例,为可持续性应用中的土地覆盖预测模型提供了关键见解。我们的代码和数据可在https://github.com/Trustworthy-ML-Lab/Describe-and-Dissect获取。
引用
@article{arxiv.2403.13771,
title = {Interpreting Neurons in Deep Vision Networks with Language Models},
author = {Nicholas Bai and Rahul A. Iyer and Tuomas Oikarinen and Akshay Kulkarni and Tsui-Wei Weng},
journal= {arXiv preprint arXiv:2403.13771},
year = {2025}
}