中文

自编码中的拓扑障碍

高能物理 - 唯象学 2021-05-06 v2 机器学习 机器学习

摘要

自编码器已被提出作为高能物理中模型无关异常检测的有力工具。其工作原理是,不属于训练数据空间的事件将被较差地重建,从而被标记为异常。我们指出,在许多感兴趣的例子中,大重建误差与异常之间的关联并不那么明确。特别地,对于具有非平凡拓扑的数据集,总会存在由于全局问题而错误看似异常的点。反之,神经网络通常具有局部插值的归纳偏置或先验,使得欠采样或稀有事件可能以较小误差被重建,尽管它们实际正是所需的异常。综合来看,这些事实与将自编码器作为异常检测器的简单图景相矛盾。使用一系列说明性的低维例子,我们明确展示了数据集的内在与外在拓扑如何影响自编码器的行为,以及该拓扑如何在训练期间于潜空间表示中显现。我们将此分析立足于对一个模拟“隆起搜寻”的讨论,其中自编码器由于 nn 粒子相空间的内在拓扑相关原因而未能识别异常的“信号”。

关键词

引用

@article{arxiv.2102.08380,
  title  = {Topological Obstructions to Autoencoding},
  author = {Joshua Batson and C. Grace Haaf and Yonatan Kahn and Daniel A. Roberts},
  journal= {arXiv preprint arXiv:2102.08380},
  year   = {2021}
}

备注

24 + 20 pages, 26 figures; no autoencoders were harmed in the making of this project. v2: JHEP published version