神经网络模块化训练有助于提高可解释性
人工智能
2024-09-25 v1
摘要
提高网络可解释性的一个方法是通过聚类性,即将模型划分为互不相交的聚类,以便独立研究。我们发现预训练模型高度不可聚类,因此通过一种"enmeshment loss"函数训练更模块化的模型,以鼓励形成非相互作用的聚类。使用自动化可解释性措施,我们展示了该方法找到的聚类学习不同的、不相交且更小的电路,用于CIFAR-10标签。我们的做法为使神经网络更易于解释提供了一条有前景的道路。
引用
@article{arxiv.2409.15749,
title = {Automated Assessment of Multimodal Answer Sheets in the STEM domain},
author = {Rajlaxmi Patil and Aditya Ashutosh Kulkarni and Ruturaj Ghatage and Sharvi Endait and Geetanjali Kale and Raviraj Joshi},
journal= {arXiv preprint arXiv:2409.15749},
year = {2024}
}