中文

AstroConcepts:面向天文学的大规模多标签分类语料库

计算与语言 2026-04-03 v1 天体物理仪器与方法 信息检索 机器学习

摘要

科学多标签文本分类 suffer于极端类别不平衡,其中专业术语 exhibits 恶劣的幂律分布,这挑战了标准分类方法。现有科学语料库缺乏 comprehensive controlled vocabularies,专注于宽泛类别,从而限制了对极端不平衡的系统性研究。我们引入 AstroConcepts,这是一个来自 21,702 篇已发表天文学论文的英文摘要语料库,标注为统一天文学词汇表 (Unified Astronomy Thesaurus) 中的 2,367 个概念。该语料库 exhibit严重的标签不平衡,其中 76% 的概念拥有不到 50 个训练样本。通过发布此资源,我们实现了对科学领域极端类别不平衡的系统性研究,并在传统方法、神经网络方法和 vocabulary-constrained LLM 方法上建立了强基准。我们的评估揭示了三个关键模式,为科学文本分类提供了新见解。首先,vocabulary-constrained LLMs 在天文学分类中相对于 domain-adapted 模型实现了竞争性能,这表明参数高效方法的潜力。其次,domain adaptation 对罕见、专业术语的改进幅度较大,尽管绝对性能在所有方法上仍有限。第三,我们提出 frequency-stratified evaluation 以揭示aggregate scores 隐藏的性能模式,从而将鲁棒性评估置于科学多标签评估的中心。这一结果为科学 NLP 提供了可操作的见解,并为研究极端不平衡 establish 了基准。

关键词

引用

@article{arxiv.2604.02156,
  title  = {AstroConcepts: A Large-Scale Multi-Label Classification Corpus for Astrophysics},
  author = {Atilla Kaan Alkan and Felix Grezes and Sergi Blanco-Cuaresma and Jennifer Lynn Bartlett and Daniel Chivvis and Anna Kelbert and Kelly Lockhart and Alberto Accomazzi},
  journal= {arXiv preprint arXiv:2604.02156},
  year   = {2026}
}

备注

9 pages, 2 figures