中文

应用于 SDSS 星系的机器学习红移数据增强

宇宙学与河外天体物理 2015-06-23 v2

摘要

我们提出了针对机器学习红移估计的数据增强分析。如果两个基础样本存在差异,数据增强可使训练样本更接近测试样本,从而改进测试样本的测量统计量。我们通过选取具有光谱红移的 80 万 (170 万) 个 SDSS DR8 (DR10) 星系进行了两组分析。我们通过施加人为的 r 波段视星等截断来构建基础训练集,仅选取亮星系,然后利用模拟并应用 K-correct 包将训练集星系人为地置于更高红移处,以此对该基础训练集进行增强。我们获得了剩余暗星系样本的红移估计值,这些样本未用于训练。我们发现,与理想情况和非增强情况之间的误差差异相比,数据增强在两组分析中均将恢复红移的误差降低了 40%。使用数据增强还将异常值比例降低了至少 10%,最高达 80%。最后,我们量化了当探测深度超过亮训练样本的人为星等极限时,恢复红移的退化情况。我们发现,在所有探索的视星等下,将数据增强与基于树的方法结合使用,可提供偏差可忽略不计的星系红移估计,尽管随着探测深度增加,恢复值的误差也会增大。这些结果适用于那些具有光谱训练集(该训练集是所有光度星系的有偏样本)的巡天项目,例如当光谱探测星等极限浅于光度极限时。

关键词

引用

@article{arxiv.1501.06759,
  title  = {Data augmentation for machine learning redshifts applied to SDSS galaxies},
  author = {Ben Hoyle and Markus Michael Rau and Christopher Bonnett and Stella Seitz and Jochen Weller},
  journal= {arXiv preprint arXiv:1501.06759},
  year   = {2015}
}

备注

13 pages, 4 figures, version accepted by MNRAS, added analysis, results and conclusions unchanged