自编码中的拓扑障碍
高能物理 - 唯象学
2021-05-06 v2 机器学习
机器学习
摘要
自编码器已被提出作为高能物理中模型无关异常检测的有力工具。其工作原理是,不属于训练数据空间的事件将被较差地重建,从而被标记为异常。我们指出,在许多感兴趣的例子中,大重建误差与异常之间的关联并不那么明确。特别地,对于具有非平凡拓扑的数据集,总会存在由于全局问题而错误看似异常的点。反之,神经网络通常具有局部插值的归纳偏置或先验,使得欠采样或稀有事件可能以较小误差被重建,尽管它们实际正是所需的异常。综合来看,这些事实与将自编码器作为异常检测器的简单图景相矛盾。使用一系列说明性的低维例子,我们明确展示了数据集的内在与外在拓扑如何影响自编码器的行为,以及该拓扑如何在训练期间于潜空间表示中显现。我们将此分析立足于对一个模拟“隆起搜寻”的讨论,其中自编码器由于 粒子相空间的内在拓扑相关原因而未能识别异常的“信号”。
引用
@article{arxiv.2102.08380,
title = {Topological Obstructions to Autoencoding},
author = {Joshua Batson and C. Grace Haaf and Yonatan Kahn and Daniel A. Roberts},
journal= {arXiv preprint arXiv:2102.08380},
year = {2021}
}
备注
24 + 20 pages, 26 figures; no autoencoders were harmed in the making of this project. v2: JHEP published version