中文

通过超额词汇探讨 LLM 在生物医学出版物中的写作

计算与语言 2025-07-04 v5 人工智能 计算机与社会 数字图书馆 社会与信息网络

摘要

大型语言模型(LLM)如 ChatGPT 能够以人类水平的性能生成和修订文本。这些模型具有明确的局限性:它们会产生不准确的信息、强化现有的偏见,并且容易被滥用。然而,许多科学家用于他们的学术写作。但这种 LLM 用法在学术文献中有多广泛?为了回答这个问题 for the field of biomedical research,我们提出了一种无偏见、大规模的方法:我们研究了来自 2010--2024 年由 PubMed 索引的超过 1500 万篇生物医学摘要中的词汇变化,显示 LLM 的出现导致某些风格词汇频率的骤增。这种超额词汇分析表明,至少有 13.5% 的 2024 年摘要是使用 LLM 处理的。这种下限在不同学科、国家和期刊之间有所不同,某些子语料库可达 40%。我们表明,LLM 对生物医学研究中的科学写作产生了前所未有的影响,超过了如新冠疫情等重大世界事件的影响。

关键词

引用

@article{arxiv.2406.07016,
  title  = {Delving into LLM-assisted writing in biomedical publications through excess vocabulary},
  author = {Dmitry Kobak and Rita González-Márquez and Emőke-Ágnes Horvát and Jan Lause},
  journal= {arXiv preprint arXiv:2406.07016},
  year   = {2025}
}

备注

v5: Reverting to v3