通过超额词汇探讨 LLM 在生物医学出版物中的写作
计算与语言
2025-07-04 v5 人工智能
计算机与社会
数字图书馆
社会与信息网络
摘要
大型语言模型(LLM)如 ChatGPT 能够以人类水平的性能生成和修订文本。这些模型具有明确的局限性:它们会产生不准确的信息、强化现有的偏见,并且容易被滥用。然而,许多科学家用于他们的学术写作。但这种 LLM 用法在学术文献中有多广泛?为了回答这个问题 for the field of biomedical research,我们提出了一种无偏见、大规模的方法:我们研究了来自 2010--2024 年由 PubMed 索引的超过 1500 万篇生物医学摘要中的词汇变化,显示 LLM 的出现导致某些风格词汇频率的骤增。这种超额词汇分析表明,至少有 13.5% 的 2024 年摘要是使用 LLM 处理的。这种下限在不同学科、国家和期刊之间有所不同,某些子语料库可达 40%。我们表明,LLM 对生物医学研究中的科学写作产生了前所未有的影响,超过了如新冠疫情等重大世界事件的影响。
引用
@article{arxiv.2406.07016,
title = {Delving into LLM-assisted writing in biomedical publications through excess vocabulary},
author = {Dmitry Kobak and Rita González-Márquez and Emőke-Ágnes Horvát and Jan Lause},
journal= {arXiv preprint arXiv:2406.07016},
year = {2025}
}
备注
v5: Reverting to v3