中文

AstroMLab 1:谁赢得天文三级决斗?

天体物理仪器与方法 2024-11-12 v2 地球与行星天体物理 星系天体物理 太阳与恒星天体物理 人工智能 计算与语言

摘要

我们present了对专有和开放权重大语言模型的全面评估,首次使用 astronomy-specific 基准数据集。该数据集包含4425个来自《年鉴综述天文学与天文物理学》的多选题,涵盖广泛的天文物理主题。我们的分析检验了模型在各种天文子领域的性能,并评估了响应校准,这对于潜在的研究环境部署至关重要。Claude-3.5-Sonnet 在各类竞争对手中取得最高可达4.6个百分点的优势,达到85.0%的准确率。对于专有模型,我们观察到每3至12个月成本都会有所下降,以在此特定天文基准测试中获得类似得分。开放权重模型取得了快速的进步,LLaMA-3-70b(80.6%)和 Qwen-2-72b(77.7%)现已与一些最佳专有模型竞争。我们识别出主题之间的性能差异,non-English-focused 模型在行星系-related 领域、恒星天文学和仪器相关问题中普遍表现较差。这可能源于训练数据较少、历史背景有限以及这些领域近期发展迅速。这种模式在开放权重和专有模型中均存在,地区依赖性显而易见,凸显了训练数据多样性对模型在专业科学领域性能的影响。表现最好的模型表现出良好的校准水平,置信度与正确性之间的相关性超过0.9,尽管它们略显保守。开放权重模型在快速低成本推理方面的发展为天文学的affordable部署提供了新机会。所观察到的快速进步表明,LLM驱动的天文学研究在可预见的未来可能变得可行。

关键词

引用

@article{arxiv.2407.11194,
  title  = {AstroMLab 1: Who Wins Astronomy Jeopardy!?},
  author = {Yuan-Sen Ting and Tuan Dung Nguyen and Tirthankar Ghosal and Rui Pan and Hardik Arora and Zechang Sun and Tijmen de Haan and Nesar Ramachandra and Azton Wells and Sandeep Madireddy and Alberto Accomazzi},
  journal= {arXiv preprint arXiv:2407.11194},
  year   = {2024}
}

备注

45 pages, 12 figures, 7 tables. Published in Astronomy & Computing. AstroMLab homepage: https://astromlab.org/