中文

使用机器学习从光学数据预测星系的中性氢含量

星系天体物理 2018-07-18 v1

摘要

我们开发了一个基于机器学习的框架,利用光学测光和环境参数等更容易观测的量来预测星系的 HI 含量。我们在 Mufasa 宇宙流体力学模拟的 z=0-2 输出上训练该算法,该模拟包含恒星形成、反馈以及一个抑制大质量星系的启发式模型,能够与包括 HI 在内的一系列巡天数据合理匹配。我们采用了多种机器学习方法(回归器),并使用均方根误差({\sc rmse})和 Pearson 相关系数(r)量化它们的性能。将 SDSS 测光、第 3 近邻环境和视线本动速度作为特征,我们获得了 HI 丰度预测 r >0.8> 0.8 的精度,对应于 {\sc rmse}<0.3<0.3。将近红外测光加入特征可对预测带来一些改进。与所有回归器相比,随机森林表现最佳,在 z=0z=0 时 r >0.9>0.9,其次是深度神经网络,r >0.85>0.85。所有回归器的性能都随红移增加而下降,这限制了该方法在 z\la1z\la 1 范围内的适用性,并且它们倾向于略微高估低 HI 星系的 HI 含量,这可能是由于训练样本中的 Eddington 偏差所致。我们在 RESOLVE 巡天数据上测试了该方法。在 RESOLVE 数据子集上进行训练后,我们发现我们的机器学习方法可以合理预测剩余 RESOLVE 数据的 HI 丰度,{\sc rmse}0.28\sim0.28。当我们在 Mufasa 的模拟数据上训练并在 RESOLVE 上测试时,该值增至 {\sc rmse}0.45\sim0.45。我们的方法将有助于在已有测光数据的区域,对即将开展的 HI 21cm 巡天(如 MeerKAT 上的 LADUMA 和 MIGHTEE 巡天)进行逐星系巡天预测和不完备性校正。

关键词

引用

@article{arxiv.1803.08334,
  title  = {Predicting the Neutral Hydrogen Content of Galaxies From Optical Data Using Machine Learning},
  author = {Mika Rafieferantsoa and Sambatra Andrianomena and Romeel Davé},
  journal= {arXiv preprint arXiv:1803.08334},
  year   = {2018}
}

备注

16 pages, 11 figures, 1 table