中文

使用 K-means 和随机森林方法的恒星、星系与类星体半监督分类

星系天体物理 2025-09-09 v4

摘要

对恒星、星系和类星体进行分类对于理解宇宙的结构与演化至关重要;然而,现代巡天产生的海量数据使得人工分类不再可行,而监督学习方法仍受限于光谱标注数据的稀缺。我们旨在通过利用半监督学习 (SSL) 来克服全监督方法的局限性,开发一种可扩展且标签高效的天体分类方法。我们提出了一种结合 K-means 聚类与随机森林分类的新型 SSL 框架。该方法将无标签数据划分为 50 个簇,将经光谱证认的质心标签传播至 95% 的簇成员,并在扩展的伪标签数据集上训练随机森林。我们将此方法应用于包含多巡天测光与光谱数据的 CPz 星表,并将其性能与全监督随机森林进行了比较。我们的 SSL 方法对恒星、星系和类星体的 F1 分数分别达到 98.8%、98.9% 和 92.0%,与监督方法(F1 分数分别为 99.1%、99.1% 和 93.1%)高度接近,且优于传统的颜色截断技术。该方法在高维特征空间中表现出鲁棒性,且与以往工作相比具有更优的标签效率。这项工作表明,在标注数据有限时,SSL 可作为天体分类的可扩展解决方案,尽管在低维设置下其性能可能有所下降。

关键词

引用

@article{arxiv.2507.14072,
  title  = {Semi-supervised classification of stars, galaxies and quasars using K-means and random-forest approaches},
  author = {Vahid Asadi and Hosein Haghi and Akram Hasani Zonoozi},
  journal= {arXiv preprint arXiv:2507.14072},
  year   = {2025}
}

备注

9 pages, 9 figures, 2 tables, Accepted for Publication in A&A