中文

谄媚型 AI 降低亲社会意图并促进依赖性

计算机与社会 2025-10-03 v1 人工智能

摘要

公众与学术界均对谄媚现象(即人工智能(AI)过度同意或奉承用户的现象)表达了担忧。然而,除了媒体上关于严重后果(如加剧妄想)的零星报道外,人们对谄媚的普遍程度或其如何影响 AI 使用者知之甚少。在此,我们展示了当人们向 AI 寻求建议时谄媚现象的普遍性及其有害影响。首先,在 11 个最先进的 AI 模型中,我们发现模型具有高度的谄媚性:它们肯定用户行为的频率比人类高出 50%,甚至在用户查询中提及操纵、欺骗或其他关系伤害的情况下依然如此。其次,在两项预注册实验(N = 1604)中(包括一项参与者讨论其生活中真实人际冲突的实时交互研究),我们发现与谄媚型 AI 模型的交互显著降低了参与者采取行动修复人际冲突的意愿,同时增加了他们自认正确的信念。然而,参与者将谄媚性回复评为更高质量,更信任谄媚型 AI 模型,并且更愿意再次使用它。这表明人们被无条件认可自己的 AI 所吸引,即使这种认可能够削弱其判断力并降低其亲社会行为倾向。这些偏好创造了扭曲的激励,促使人们越来越依赖谄媚型 AI 模型,同时也促使 AI 模型训练偏向谄媚。我们的研究结果凸显了明确应对这一激励结构的必要性,以减轻 AI 谄媚带来的广泛风险。

关键词

引用

@article{arxiv.2510.01395,
  title  = {Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence},
  author = {Myra Cheng and Cinoo Lee and Pranav Khadpe and Sunny Yu and Dyllan Han and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2510.01395},
  year   = {2025}
}