视觉Transformer的可解释性:全面综述与新视角
计算机视觉与模式识别
2023-11-14 v1
摘要
Transformer对自然语言处理影响重大,且近期在计算机视觉中展现出潜力。其在基础计算机视觉任务上已显示优于卷积神经网络的前景结果。然而,科学界尚未完全掌握视觉Transformer的内部机制,亦不明其决策依据,这凸显了可解释性方法的重要性。理解这些模型如何得出决策不仅提升其性能,也构建对AI系统的信任。本研究探索为视觉Transformer提出的不同可解释性方法,并依据其动机、结构与应用场景给出分类体系。此外,全面综述可用于比较解释结果的评估准则,以及可解释性工具与框架。最后,论文强调可增强视觉Transformer可解释性但尚未探索的关键方面,并建议值得未来投入的有前景研究方向。
引用
@article{arxiv.2311.06786,
title = {Explainability of Vision Transformers: A Comprehensive Review and New Perspectives},
author = {Rojina Kashefi and Leili Barekatain and Mohammad Sabokrou and Fatemeh Aghaeipoor},
journal= {arXiv preprint arXiv:2311.06786},
year = {2023}
}
备注
20 pages,5 figures