中文

衡量与减轻 AI 写作辅助中的人物扭曲

计算与语言 2026-04-27 v1

摘要

数亿人使用人工智能(AI)进行写作辅助。本文评估了AI写作辅助如何扭曲作家人物形象——即其被感知的信念、性格和身份。在三个大规模实验中,作家(N=2,939)在有无AI辅助的情况下撰写政治意见段落。读者(N=11,091)在无知的情况下对这些段落进行评估,跨越29个社会 salient 维度的读者感知,涵盖政治意见、写作质量、作家性格、情感和人口统计特征。AI写作辅助在所有维度上都产生了人物扭曲:使用AI后,作家显得更具意见、更有能力、更积极,他们的感知人口统计轮廓向更特权的群体移动。作家对许多观察到的扭曲表示反对,但仍然倾向于在意识到这些扭曲后继续使用AI辅助文本。我们成功地通过在实验数据上训练奖励模型(10,008段文本,2,903,596项评分)来减轻可辩驳的人物扭曲,使AI输出更忠实地代表作家立场。然而,这以牺牲用户接受度为代价,表明AI写作辅助的可取与不可取属性之间存在难以调和的纠缠。总体而言,我们的发现表明,AI写作辅助造成的人物扭曲在人类监督的现实条件下仍然普遍且持久,这对随AI采纳规模扩大的公共话语、信任和民主 deliberation 具有启示。

关键词

引用

@article{arxiv.2604.22503,
  title  = {Measuring and Mitigating Persona Distortions from AI Writing Assistance},
  author = {Paul Röttger and Kobi Hackenburg and Hannah Rose Kirk and Christopher Summerfield},
  journal= {arXiv preprint arXiv:2604.22503},
  year   = {2026}
}

备注

For supplementary information, code, and data see https://github.com/paul-rottger/ai-distortion