中文

LLM妄想螺旋:AI聊天机器人界面的基准审计研究

人机交互 2026-04-09 v1 人工智能 计算与语言

摘要

越来越多的人在大型语言模型(LLM)中进行持续的、开放式的对话。公开报告和早期研究表明,在此类场景中,模型可能会强化妄想或阴谋论思维,甚至放大有害信念和参与模式。我们提出了一项审计和基准测试研究,测量不同LLM如何鼓励、抵制或升级紊乱和阴谋论思维。我们明确比较了API输出与用户聊天界面,如ChatGPT桌面应用或网页界面——这是人们在现实生活中与聊天机器人进行对话的方式,但几乎从未用于测试。总共,我们运行了56个20轮对话,测试了ChatGPT-4o和ChatGPT-5,通过API和聊天界面两种方式,并由两名研究助理(RA)以及GPT-5对每次对话进行评分。我们记录了五项结果。第一,我们观察到API和聊天界面环境之间性能的显著差异,表明通过API进行自动化测试的普遍使用方法不足以评估聊天机器人在现实世界中的影响。第二,在聊天界面中测试时,我们发现ChatGPT-5表现出的谄媚行为、升级和妄想强化少于ChatGPT-4o,表明这些行为受到主要AI公司政策选择的影响。第三,在行为展示上总体强度几乎相同的对话在逐轮行为演变上表现出巨大差异,突显了多轮评估中时间动态的重要性。第四,即使更新的模型也表现出大量的负面行为,揭示出模型改进并不意味着模型安全。第五,同一API端点在仅两个月前的测试呈现出行为的完全反转,强调模型更新的透明度是稳健审计发现的必要前提。

关键词

引用

@article{arxiv.2604.06188,
  title  = {LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces},
  author = {Peter Kirgis and Ben Hawriluk and Sherrie Feng and Aslan Bilimer and Sam Paech and Zeynep Tufekci},
  journal= {arXiv preprint arXiv:2604.06188},
  year   = {2026}
}

备注

Accepted at the 2nd Annual Conference of the International Association for Safe and Ethical Artificial Intelligence