大规模语言模型作为科学综述的评估器
计算与语言
2024-07-04 v1 人工智能
信息论
math.IT
摘要
我们的研究探讨了最先进的大规模语言模型(LLM),如 GPT-4 和 Mistral,如何评估科学摘要或更恰当地说,科学综述的质量,将其评估与人类注释员的评估进行比较。我们使用一个包含 100 个研究问题及其由 GPT-4 从五个相关论文的摘要中制作的综述的数据集,核对人类质量评级。该研究评估了闭源 GPT-4 和开源 Mistral 模型对这些摘要进行评级并提供其判断依据的能力。初步结果表明,LLM 可以提供与质量评级一定程度上匹配的逻辑解释,但更深入的统计分析显示,LLM 与人类评级之间存在较弱的相关性,这表明了 LLM 在科学综述评估方面的潜力以及当前的局限性。
引用
@article{arxiv.2407.02977,
title = {Large Language Models as Evaluators for Scientific Synthesis},
author = {Julia Evans and Jennifer D'Souza and Sören Auer},
journal= {arXiv preprint arXiv:2407.02977},
year = {2024}
}
备注
4 pages, forthcoming as part of the KONVENS 2024 proceedings https://konvens-2024.univie.ac.at/