在高度不平衡的测光数据集中提升 QSO 选择的召回率
天体物理仪器与方法
2023-12-21 v1
摘要
背景。明亮类星体的识别对于探测星系际介质和解决宇宙学中的开放性问题具有重要意义。目前已采用多种方法在现有测光巡天中寻找此类源,包括机器学习方法。然而,与污染源(如恒星和星系)相比,高红移明亮类星体十分稀有,这使得选择可靠候选者成为一项困难的任务,尤其是在要求高完备性时。目的。我们提出了一种新技术,用于在由恒星、星系和低红移类星体主导的测光数据集(不平衡数据集)中提升类星体选择的召回率(即所考虑样本内的完备性)。方法。我们的方法通过迭代移除属于非感兴趣类别的概率超过用户定义阈值的源来运作,直到剩余数据集主要包含高红移类星体。任何现有的机器学习方法都可用作底层分类器,前提是它允许估计分类概率。我们将该方法应用于通过交叉匹配 PanSTARRS1、Gaia 和 WISE 获得的数据集,并使用我们的方法及其直接多标签对应方法识别了高红移类星体候选者。结果。我们通过随机选择训练和测试数据集进行了多次测试,并在召回率上取得了显著提升:对于 的类星体,召回率从 50% 提升至 85%;对于 的类星体,召回率从 70% 提升至 90%。此外,我们在 260 万个无已知分类的源样本中识别出 3098 个新类星体候选者。我们对 121 个候选者进行了后续光谱观测,确认了 107 个 的新类星体。最后,将我们的候选者与独立方法选择的候选者进行比较表明,两个样本的重叠率超过 90%,并且两种方法都能达到高水平的完备性。
引用
@article{arxiv.2312.13194,
title = {Boost recall in QSO selection from highly imbalanced photometric datasets},
author = {Giorgio Calderone and Francesco Guarneri and Matteo Porru and Stefano Cristiani and Andrea Grazian and Luciano Nicastro and Manuela Bischetti and Konstantina Boutsia and Guido Cupani and Valentina D'Odorico and Chiara Feruglio and Fabio Fontanot},
journal= {arXiv preprint arXiv:2312.13194},
year = {2023}
}
备注
Accepted for publication on A&A