一种用于机器学习标注大型星系图像数据库的混合方法
天体物理仪器与方法
2018-10-29 v1
摘要
现代天文学依赖于机器人望远镜和数字巡天收集的海量数据库,其数据获取速度远超人工分析所能支持的范围。除其他数据外,这些巡天还收集了数百万乃至数十亿河外天体的信息。由于天体数量极其庞大,人工观测不切实际,因此需要能够分析并标注河外天体的自动方法,以充分利用这些数据库的发现能力。用于天体标注的机器学习方法大致可分为利用数字巡天所测光度信息的方法,以及分析天体图像的方法。本文描述了一种结合测光与图像数据、按形态对星系进行标注的混合方法,以及利用该信息识别与查询天体视觉相似对象(按例查询)的方法。结果分别与仅使用SDSS测光信息、以及仅使用直接从图像提取的形态描述符的情况进行比较。比较表明,对于自动分类,图像数据相对于测光数据所提供的信息仅有边际增益。然而对于按例查询,图像数据分析提供了更多信息,显著改善了自动检测。该方法的源代码与二进制文件可通过天体物理源代码库下载。
引用
@article{arxiv.1810.11283,
title = {A hybrid approach to machine learning annotation of large galaxy image databases},
author = {Evan Kuminski and Lior Shamir},
journal= {arXiv preprint arXiv:1810.11283},
year = {2018}
}
备注
A&C, accepted