面向人工生成科学研究的自动评估指标
计算机与社会
2025-03-11 v1 人工智能
机器学习
摘要
基础模型在科学研究中的应用日益广泛,但评估AI生成的科学工作仍具挑战性。专家评审成本高昂,而作为代理评审员的大型语言模型(LLMs)已被证明是不可靠的。为了解决这一问题,我们研究了两种自动评估指标,具体为引用计数预测和评审打分预测。我们解析了OpenReview上的所有论文,并用其引用计数、参考文献和研究假设对每篇投稿进行了扩充。我们的发现表明,引用计数预测比评审打分预测更可行,且仅从研究假设预测分数比从全文预测更困难。此外,我们表明,仅基于标题和摘要的简单预测模型优于基于LLM的评审器,尽管它仍未达到人类水平的一致性。
引用
@article{arxiv.2503.05712,
title = {Automatic Evaluation Metrics for Artificially Generated Scientific Research},
author = {Niklas Höpner and Leon Eshuijs and Dimitrios Alivanistos and Giacomo Zamprogno and Ilaria Tiddi},
journal= {arXiv preprint arXiv:2503.05712},
year = {2025}
}