中文

面向学术出版物新颖性评估的大型语言模型评测与增强

计算与语言 2024-09-26 v1 人工智能 信息检索 机器学习

摘要

近期的研究主要从语义角度,利用认知科学的基准来评估大型语言模型(LLMs)的创造力/新颖性。然而,评估学术出版物的新颖性在 LLM 评测中是一个很大程度上未被探索的领域。在本文中,我们引入了一个学术新颖性基准(SchNovel)来评估 LLM 评估学术论文新颖性的能力。SchNovel 包含从 arXiv 数据集中采样的六个领域的 15000 对论文,其发表日期跨度为 2 到 10 年。在每对论文中,假设最近发表的论文更具新颖性。此外,我们提出了 RAG-Novelty,它通过检索相似论文来评估新颖性,从而模拟人类审稿人所采取的审稿过程。大量实验提供了关于不同 LLM 评估新颖性能力的见解,并表明 RAG-Novelty 优于最近的基线模型。

关键词

引用

@article{arxiv.2409.16605,
  title  = {Evaluating and Enhancing Large Language Models for Novelty Assessment in Scholarly Publications},
  author = {Ethan Lin and Zhiyuan Peng and Yi Fang},
  journal= {arXiv preprint arXiv:2409.16605},
  year   = {2024}
}

备注

under review