无标签分类:从高能物理的混合样本中学习
高能物理 - 唯象学
2017-11-21 v3 高能物理 - 实验
机器学习
摘要
现代机器学习技术可用于为困难的对撞机物理问题构建强大的模型。然而,在许多应用中,由于数据中缺乏真实级信息,这些模型是在不完美的模拟上训练的,这带来了模型学习模拟伪影的风险。在本文中,我们引入了无标签分类(CWoLa)范式,其中训练分类器以区分类的统计混合,这在对撞机物理中很常见。至关重要的是,它既不需要单个标签也不需要类别比例,但我们证明了 CWoLa 范式中的最优分类器也是在所有标签信息均可用的传统全监督情况下的最优分类器。在分析性玩具示例中展示了该方法的强大功能后,我们考虑了对撞机物理的一个现实基准:使用混合的夸克/胶子训练样本来区分夸克引发的喷注与胶子引发的喷注。更一般地,CWoLa 可应用于标签或类别比例未知或模拟不可靠但存在类别统计混合的任何分类问题。
引用
@article{arxiv.1708.02949,
title = {Classification without labels: Learning from mixed samples in high energy physics},
author = {Eric M. Metodiev and Benjamin Nachman and Jesse Thaler},
journal= {arXiv preprint arXiv:1708.02949},
year = {2017}
}
备注
18 pages, 5 figures; v2: intro extended and references added; v3: additional discussion to match JHEP version