中文

视觉Transformer的可解释性:全面综述与新视角

计算机视觉与模式识别 2023-11-14 v1

摘要

Transformer对自然语言处理影响重大,且近期在计算机视觉中展现出潜力。其在基础计算机视觉任务上已显示优于卷积神经网络的前景结果。然而,科学界尚未完全掌握视觉Transformer的内部机制,亦不明其决策依据,这凸显了可解释性方法的重要性。理解这些模型如何得出决策不仅提升其性能,也构建对AI系统的信任。本研究探索为视觉Transformer提出的不同可解释性方法,并依据其动机、结构与应用场景给出分类体系。此外,全面综述可用于比较解释结果的评估准则,以及可解释性工具与框架。最后,论文强调可增强视觉Transformer可解释性但尚未探索的关键方面,并建议值得未来投入的有前景研究方向。

关键词

引用

@article{arxiv.2311.06786,
  title  = {Explainability of Vision Transformers: A Comprehensive Review and New Perspectives},
  author = {Rojina Kashefi and Leili Barekatain and Mohammad Sabokrou and Fatemeh Aghaeipoor},
  journal= {arXiv preprint arXiv:2311.06786},
  year   = {2023}
}

备注

20 pages,5 figures