深度视觉分类模型的可解释性与鲁棒性
表示论
2023-01-13 v2 代数几何
辛几何
摘要
在计算机视觉领域,上世纪 80 年代首次提出的卷积神经网络(CNNs)已成为标准的视觉分类模型。近来,作为 CNN 的替代方案,胶囊网络(CapsNets)与视觉 Transformer(ViTs)被提出。受人类大脑信息处理的启发,CapsNets 被认为比 CNNs 具有更多的归纳偏置,而 ViTs 被认为比 CNNs 具有更少的归纳偏置。这三种分类模型都受到了极大关注,因为它们可作为各种下游任务的骨干网络。然而,这些模型远非完美。正如学界所指出的,标准深度神经网络(DNNs)存在两个弱点。DNN 的局限之一是可解释性不足。即便它们能在图像分类任务中达到或超越人类专家表现,基于 DNN 的决策仍难以理解。但在许多现实应用中,单个决策需要被解释。DNN 的另一个局限是对抗脆弱性。具体而言,输入的小且不可察觉的扰动可误导 DNN。深度神经网络的脆弱性对当前视觉分类模型提出了挑战。其潜在威胁可能导致不可接受的后果。此外,研究模型的对抗脆弱性有助于更好地理解底层模型。我们的研究旨在解决 DNN 的这两个局限。具体而言,我们关注深度视觉分类模型,尤其是各分类模型的核心构建部分,例如 CapsNets 中的动态路由与 ViTs 中的自注意力模块。
引用
@article{arxiv.2301.01342,
title = {Invariance of microsheaves on stable Higgs bundles},
author = {David Nadler and Vivek Shende},
journal= {arXiv preprint arXiv:2301.01342},
year = {2023}
}
备注
10 pages