ViTree:用于逐步可解释细粒度视觉分类的单路径神经树
计算机视觉与模式识别
2024-01-31 v1 人工智能
摘要
随着计算机视觉的不断进步并在各个领域得到广泛应用,深度学习模型的可解释性需求变得至关重要。现有方法通常采用事后技术或原型来解释决策过程,这可能不够直接且缺乏内在说明。在本研究中,我们引入了 ViTree,这是一种用于细粒度视觉分类的新方法,它将流行的视觉Transformer作为特征提取骨干与神经决策树相结合。通过遍历树路径,ViTree 有效地从Transformer处理后的特征中选择图像块以突出信息丰富的局部区域,从而以逐步的方式细化表示。与以往依赖软分布或路径集成的基于树的模型不同,ViTree 选择单条树路径,提供了更清晰、更简单的决策过程。这种图像块和路径的选择性增强了 ViTree 的模型可解释性,使得能够更好地洞察模型的内部运作机制。值得注意的是,大量实验验证了这种精简的方法超越了各种强有力的竞争对手,并达到了最先进的性能,同时保持了卓越的可解释性,这一点已通过多角度方法得到证明。代码可在 https://github.com/SJTU-DeepVisionLab/ViTree 获取。
引用
@article{arxiv.2401.17050,
title = {ViTree: Single-path Neural Tree for Step-wise Interpretable Fine-grained Visual Categorization},
author = {Danning Lao and Qi Liu and Jiazi Bu and Junchi Yan and Wei Shen},
journal= {arXiv preprint arXiv:2401.17050},
year = {2024}
}