中文

大语言模型用于 post-publication 科研评估:来自专家推荐与引文指标的证据

数据库 2026-04-21 v1 人工智能 计算机与社会

摘要

评估科学研究质量是学术交流的核心任务,但现有方法在可扩展性、主观性和时间延迟方面存在局限。近期大语言模型 (LLM) 的进展为基于文本内容的自动化科研评估提供了新机会。本研究检验 LLM 是否能支持 post-publication 同行评审任务,通过将模型输出与专家判断和引文指标进行基准测试。本文基于 H1 Connect 平台构建两个评估任务:识别高质量文章以及进行更细粒度的评估,包括文章评分、价值分类和专家风格评论。评估多个模型家族,包括 BERT 模型、通用 LLM 和推理导向 LLM,在多种学习策略下。结果表明,LLM 在粗粒度评估任务中表现良好,在识别高度推荐文章方面准确率超过 0.8。但在细粒度评分任务中表现显著下降。few-shot 提示显著优于 zero-shot 设置,而监督式微调产生最强且最均衡的结果。检索增强式提示在某些情况下提升了分类准确率,但未能稳健地提升与引文指标的一致性。模型输出与引文指标之间的整体相关性虽为正,但仅为中等。

关键词

引用

@article{arxiv.2604.16386,
  title  = {DAOnt: A Formal Ontology for EU Data Act Compliance},
  author = {Sheyla Leyva-Sánchez and Fabian Linde and Meem Arafat Manab and María Poveda-Villalón and Víctor Rodríguez-Doncel},
  journal= {arXiv preprint arXiv:2604.16386},
  year   = {2026}
}