中文

AstroMLab 4:70B 参数领域专用推理模型在天文学问答中的超越基准线性能

天体物理仪器与方法 2026-02-23 v2 机器学习

摘要

通用大语言模型(LLM)尽管能力广泛,但在专业领域知识方面往往表现不佳。这一差距阻碍了它们在天文学等要求苛刻的领域作为可靠研究代理的部署。在我们此前 AstroSage-Llama-3.1-8B 工作的基础上,本研究提出了 AstroSage-Llama-3.1-70B,一个具有 700 亿参数的领域专用自然语言 AI 助手。其设计面向天文学、天体物理学、空间科学、天体粒子物理、宇宙学及天文仪器等领域的研究与教育。AstroSage-Llama-3.1-70B 以 Meta-Llama-3.1-70B 为基础,经过在天文文献大规模语料上的广泛持续预训练(CPT),随后进行监督微调(SFT)和模型合并。我们将推理链集成到 SFT 数据集中,使 AstroSage-Llama-3.1-70B 能够立即回答用户查询,或首先输出可读的推理过程。在 AstroMLab-1 基准(Ting et al., 2024)经过验证的 3,846 个问题子集(来源于训练期间未使用的文献)上的评估结果显示,AstroSage-Llama-3.1-70B 达到了顶尖性能(89.0%),与 GPT-5.2、Claude-4.5-Opus 和 Gemini-3-Pro 持平,同时更具成本效益。本工作表明,领域专用化应用于大规模模型时,可使其在如天文学等专门知识领域超越通用模型,从而推动该领域 AI 能力的前沿。

关键词

引用

@article{arxiv.2505.17592,
  title  = {AstroMLab 4: Benchmark-Topping Performance in Astronomy Q&A with a 70B-Parameter Domain-Specialized Reasoning Model},
  author = {Tijmen de Haan and Yuan-Sen Ting and Tirthankar Ghosal and Tuan Dung Nguyen and Alberto Accomazzi and Emily Herron and Vanessa Lama and Rui Pan and Azton Wells and Nesar Ramachandra},
  journal= {arXiv preprint arXiv:2505.17592},
  year   = {2026}
}