中文

估计学术写作中LLM辅助文本的普遍程度

数字图书馆 2025-12-02 v1

摘要

自2022年底ChatGPT发布以来,大语言模型(LLM)在学术出版物中的使用急剧增长。这种使用通常未公开披露,读者和审稿人往往难以识别由人类撰写但经LLM修订或翻译的文本,或主要由LLM生成的文本。鉴于与LLM生成文本相关的已知质量和可靠性问题,其潜在增长对研究诚信和公众对研究的信任构成了日益严重的问题。本研究提出了一种简单且易于复现的方法,用于展示Dimensions数据库中索引的各类研究已发表论文全文中LLM工具使用的增长情况。它利用该方法证明,基于特定指示性词语的不成比例使用,LLM工具很可能已参与了2024年所有已发表论文中超过10%的文本生成,并综合早期研究确认这是一个合理的总体估计。随后讨论了这对学术出版完整性的影响,展示了证据表明作者仍在隐瞒或淡化LLM用于文本生成的使用,并提出迫切需要更全面的披露要求来应对这一问题。

关键词

引用

@article{arxiv.2512.01560,
  title  = {Estimating the prevalence of LLM-assisted text in scholarly writing},
  author = {Andrew Gray},
  journal= {arXiv preprint arXiv:2512.01560},
  year   = {2025}
}

备注

19 pages, 3 figures