中文

SC4ANM:用于自动化学术论文新颖性预测的最优章节组合识别

计算与语言 2025-05-23 v1 人工智能 数字图书馆

摘要

新颖性是学术论文的核心组成部分,存在多种观点对其评估进行论述。现有方法往往关注单词或实体的组合,这些组合提供的见解有限。与论文相关的新颖性内容通常分布在论文的不同核心章节中,如导论、方法和结果。因此,探索论文章节组合的最优组合,以评估论文的新颖性,对推动自动化新颖性评估具有重要意义。本文利用不同章节组合作为输入驱动语言模型预测新颖性分数。我们分析结果以确定用于新颖性分数预测的最优章节组合。首先,我们采用自然语言处理技术识别学术论文的章节结构,将其分为导论、方法、结果和讨论(IMRaD)。随后,我们使用不同的章节组合(例如导论和方法)作为预训练语言模型(PLMs)和大语言模型(LLMs)的输入,采用由人类专家评审者提供的新颖性分数作为ground truth标签获取预测结果。结果表明,使用导论、结果和讨论对于评估论文新颖性最为合适,而使用完整文本并未获得显著结果。此外,基于PLMs和LLMs的结果显示,导论和结果似乎是该任务中最重要的章节。本论文的代码和数据集可在https://github.com/njust-winchy/SC4ANM访问。

关键词

引用

@article{arxiv.2505.16330,
  title  = {SC4ANM: Identifying Optimal Section Combinations for Automated Novelty Prediction in Academic Papers},
  author = {Wenqing Wu and Chengzhi Zhang and Tong Bao and Yi Zhao},
  journal= {arXiv preprint arXiv:2505.16330},
  year   = {2025}
}