17%的差距:量化AI辅助综述论文中的认知衰退
计算机与社会
2026-01-27 v1 人工智能
计算与语言
数字图书馆
摘要
大型语言模型(LLM)在科学写作中的应用提高了效率,但也带来了引入信息熵的风险。虽然“幻觉论文”是已知的伪影,但有效引用链的系统性退化尚未被量化。我们对2024年9月至2026年1月间发表的50篇近期人工智能综述论文(N=5,514次引用)进行了取证审计。我们利用结合了DOI解析、Crossref元数据分析、Semantic Scholar查询和模糊文本匹配的混合验证流程,以区分格式错误(“草率”)和可验证的不存在(“幻影”)。我们检测到持续的17.0%的幻影率——即尽管进行了积极的取证恢复,仍无法解析到任何数字对象的引用。诊断分类揭示了三种不同的失效模式:纯幻觉(5.1%)、带有有效标题的幻觉标识符(16.4%)以及解析导致的匹配失败(78.5%)。纵向分析显示趋势平坦(+0.07个百分点/月),表明高熵引用实践已稳定为该领域的地方性特征。AI综述文献中的科学引用图呈现出大规模的“链接腐烂”。这表明一种机制,即AI工具充当“懒惰的研究助手”,检索正确的标题但幻觉元数据,从而切断了可重复科学所需的数字监管链。
引用
@article{arxiv.2601.17431,
title = {The 17% Gap: Quantifying Epistemic Decay in AI-Assisted Survey Papers},
author = {H. Kemal İlter},
journal= {arXiv preprint arXiv:2601.17431},
year = {2026}
}