中文

DORA:探索深度神经网络中的离群表示

机器学习 2023-07-11 v4 人工智能 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNNs)擅长在其内部表示中学习复杂抽象。然而,它们学到的概念仍然不透明,当模型无意中学习到虚假相关性时,这一问题尤为严重。本工作中,我们提出DORA(Data-agnOstic Representation Analysis,数据无关表示分析),这是首个用于分析DNN表示空间的数据无关框架。我们框架的核心是被提出的极端激活(EA)距离度量,它通过分析表示在引起最高激活水平的数据点上的激活模式来评估表示间的相似性。由于虚假相关性常表现为相对于期望任务异常的数据特征(如水印或伪影),我们证明通过分析神经表示内部关系,可以找到能够检测此类伪影概念的内部表示。我们从定量上验证了EA度量,证明了其在受控场景和真实世界应用中的有效性。最后,我们给出流行计算机视觉模型中的实际示例,说明利用EA度量识别为离群的表示通常对应于不期望的虚假概念。

关键词

引用

@article{arxiv.2206.04530,
  title  = {DORA: Exploring Outlier Representations in Deep Neural Networks},
  author = {Kirill Bykov and Mayukh Deb and Dennis Grinwald and Klaus-Robert Müller and Marina M. -C. Höhne},
  journal= {arXiv preprint arXiv:2206.04530},
  year   = {2023}
}

备注

24 pages, 18 figures