中文

绘制科学论文中LLM使用日益增长的图谱

计算与语言 2024-04-02 v1 人工智能 数字图书馆 机器学习 社会与信息网络

摘要

科学出版通过传播研究发现、促进合作、鼓励可重复性,并确保科学知识可获取、可验证并随时间积累,为科学奠定了基础。最近,关于有多少人在学术写作中使用像ChatGPT这样的大型语言模型(LLM),以及这一工具可能对全球科学实践产生多大影响,存在大量猜测。然而,我们缺乏对学术写作中被LLM大幅修改或生成的比例的精确度量。为弥补这一空白,我们利用语料库层面的统计框架,对2020年1月至2024年2月期间发表在arXiv、Nature组合期刊上的950,965篇论文进行了首次系统性的大规模分析,以衡量LLM修改内容的普遍性随时间的变化。我们的统计估计在语料库层面运作,比在单个实例上的推断更稳健。我们的发现揭示了LLM使用的稳步增长,其中计算机科学论文的增长最大且最快(高达17.5%)。相比之下,数学论文和Nature组合期刊的LLM修改程度最低(高达6.3%)。此外,在总体层面上,我们的分析表明,LLM修改程度较高的论文与第一作者更频繁发布预印本、研究领域更拥挤以及论文篇幅较短相关。我们的发现表明,LLM正被广泛用于科学写作中。

关键词

引用

@article{arxiv.2404.01268,
  title  = {Mapping the Increasing Use of LLMs in Scientific Papers},
  author = {Weixin Liang and Yaohui Zhang and Zhengxuan Wu and Haley Lepp and Wenlong Ji and Xuandong Zhao and Hancheng Cao and Sheng Liu and Siyu He and Zhi Huang and Diyi Yang and Christopher Potts and Christopher D Manning and James Y. Zou},
  journal= {arXiv preprint arXiv:2404.01268},
  year   = {2024}
}