中文

从查询到标准:理解天文学家如何评估大语言模型

计算与语言 2025-08-07 v2 天体物理仪器与方法

摘要

尽管对利用大语言模型(LLMs)辅助天文学及其他科学研究兴趣日益增长,但通用基准在LLMs评估方面尚未跟得上实际用户评估和使用方式日益多样化的步伐。本研究通过构建对用户如何评估LLMs的理解,旨在改进评估程序。我们聚焦于一个具体场景:通过Slack部署的、基于LLMs的检索增强生成聊天机器人,用于与天文文献互动。我们对该机器人在四周内收集的368个查询进行归纳编码,并对11名天文学家进行后续访谈,揭示了人类如何评估该系统,包括提问类型及判断响应标准。我们将发现结果归纳为构建更好基准的具体建议,并据此构建了评估天文学LLMs的示例基准。总体而言,本工作提供了改进LLMs评估及最终可用性的方法,尤其适用于科学研究场景。

关键词

引用

@article{arxiv.2507.15715,
  title  = {From Queries to Criteria: Understanding How Astronomers Evaluate LLMs},
  author = {Alina Hyk and Kiera McCormick and Mian Zhong and Ioana Ciucă and Sanjib Sharma and John F Wu and J. E. G. Peek and Kartheik G. Iyer and Ziang Xiao and Anjalie Field},
  journal= {arXiv preprint arXiv:2507.15715},
  year   = {2025}
}

备注

Accepted to the Conference on Language Modeling 2025 (COLM), 22 pages, 6 figures