探究科学论文在时间与学科上的原创性:定量分析
数字图书馆
2025-12-11 v2
摘要
科学创造力的研究长期以来致力于寻找能够捕捉文章及其他科学作品中所包含科学洞见原创性的定量指标。近年来,该领域的研究活动因自然语言处理和网络分析的进步而显著扩展,已成功运用宏观和微观方法。然而,这些方法往往不检查文本本身以获取原创性证据。本文将与原创性相关的计算度量——发散语义整合(Divergent Semantic Integration, DSI)——应用于来自Web of Science的51,200篇科学摘要和标题。为适用于科学文本,本文通过纳入SciBERT(在科学语料库上训练的模型)来扩展原始BERT方法。我们观察到,DSI在少数作者的论文早期引用累积中发挥更重要作用,跨学科差异显著,随时间推移其与引用次数之间的相关性呈下降趋势。此外,通过将SciBERT-DSI和BERT-DSI建模为预测5年引用计数对数(包括学科、出版年份和作者数量的对数),我们发现统计学上显著的关系,BERT-DSI和SciBERT-DSI的调整R平方分别为0.103和0.101。由于现有科学计量指标很少评估文本中所表达的原创性,DSI提供了直接量化科学写作中嵌入概念原创性的有价值手段。
引用
@article{arxiv.2512.07892,
title = {Investigating the originality of scientific papers across time and domain: A quantitative analysis},
author = {Jack H. Culbert and Yoed N. Kenett and Philipp Mayr},
journal= {arXiv preprint arXiv:2512.07892},
year = {2025}
}
备注
39 pages, 10 figures,