AstroAlertBench:评估多模态大语言模型在天文分类中的准确性、推理与诚实度
天体物理仪器与方法
2026-05-08 v1 人工智能
摘要
现代天文观测站生成海量的多模态数据,导致专家人工审核成为关键瓶颈。虽然多模态大语言模型(LLM)在解释复杂视觉和文本输入方面显示出前景,但其在执行专门科学分类并提供可解释推理方面的能力仍受到 insufficient 研究的约束。我们引入 AstroAlertBench,这是一个综合性的多模态基准,旨在沿着三个阶段的逻辑链评估 LLM 在天文事件审查中的性能:元数据锚定、科学推理以及五类分层分类。我们采用 1,500 份来自 Zwicky Transient Facility(ZTF)的真实世界警报样本,该宽视场调查扫描北半球以检测瞬态天文事件。在该数据集上,我们对 13 种支持视觉输入的前沿闭源和开源 LLM 进行基准测试。我们的结果揭示了高准确性并不一定与模型“诚实度”一致,后者定义为自我评估其推理能力,这会影响其作为真实世界助手的可靠性。我们进一步初始化人类在环评估协议,作为未来社区规模参与的先导。总之,AstroAlertBench 提供了一个用于开发已校准且可解释天文助手的框架。
引用
@article{arxiv.2605.05573,
title = {AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification},
author = {Claire Chen and Jiabao Sean Xiao and Shuze Daniel Liu and Facundo Perez Paolino and Luke Handley and Theophile Jegou du Laz and Ricky Nilsson and Alice Zou and Matthew Graham and Ashish Mahabal},
journal= {arXiv preprint arXiv:2605.05573},
year = {2026}
}