AI 评估可能偏离真相:学术写作中背景的重要性
计算与语言
2026-05-27 v1 人工智能
综合经济学
经济学
摘要
本文检讨了当评估方法忽略不同国家和学科之间的背景差异时,对科学写作中 AI 使用的估计可能受到偏见。我们利用 Dimensions 中的大规模期刊出版数据,构建了基于人类撰写摘要与 LLM 重述摘要差异的 AI 似然性基准。我们展示,池化基准可能混淆预先存在的风格差异与 AI 生成的文本,即使在未使用 LLM 的出版物中,也会在国家-学科组之间产生显著扭曲。相比之下,基于国家-学科特定基准的评估能减轻此类扭曲,为比较提供更可信的基准。将这些方法应用于2025年的出版物后发现,池化基准在某些国家和学科中系统性地高估了 AI 的使用,而在其他国家和学科中则低估了使用。这些发现凸显了在准确且公平地评估科学中 AI 使用方面,背景感知测量的重要性。
引用
@article{arxiv.2605.26662,
title = {AI evaluation may bias perceptions: The importance of context in interpreting academic writing},
author = {Shang Wu and Randol Yao},
journal= {arXiv preprint arXiv:2605.26662},
year = {2026}
}