每个人都更喜欢人类作家,包括 AI
人工智能
2025-10-13 v1 计算与语言
人机交互
摘要
随着 AI 写作工具的普及,我们需要了解人类和机器如何评估文学风格——这一领域缺乏客观标准且判断本质上是主观的。我们使用Raymond Queneau的《1947年写作练习》(Exercises in Style)进行受控实验,以衡量归因偏见。研究1比较了人类参与者 (N=556) 和 AI 模型 (N=13) 在三个条件下评估 Queneau 文本与 GPT-4 生成版本的文学段落:盲选、准确标注和反事实标注。研究2测试了偏见在 14×14 的 AI 评估者与创作者矩阵中的泛化。两个研究均揭示了系统性的人类归因偏见。人类显示出 +13.7 个百分点 (pp) 的偏见 (Cohen's h = 0.28, 95% CI: 0.21-0.34),而 AI 模型显示出 +34.3 个百分点的偏见 (h = 0.70, 95% CI: 0.65-0.76),为人类倾向的 2.5 倍 (P<0.001)。研究2确认此偏见在不同 AI 架构中也存在 (+25.8pp, 95% CI: 24.1-27.6%),表明 AI 系统在文本被标记为“AI 生成”时会系统性地贬低创意内容,无论由哪个 AI 创建。我们还发现,归因标签会导致评估者反转评估标准,Identical features 根据仅凭感知到的作者身份就获得相反的评价。这表明 AI 模型在训练期间吸收了人类对人工创意的偏见。我们的研究代表了对审美判断中人类与人工评估者归因偏见的首次受控比较,揭示了 AI 系统不仅复制而且放大了这种人类倾向。
引用
@article{arxiv.2510.08831,
title = {Everyone prefers human writers, including AI},
author = {Wouter Haverals and Meredith Martin},
journal= {arXiv preprint arXiv:2510.08831},
year = {2025}
}
备注
46 pages, 18 figures (5 main text + 13 supplementary), 5 tables