中文

通过人类-LLM 聊天记录刻画错觉螺旋

计算与语言 2026-03-18 v1 人工智能

摘要

随着大型语言模型 (LLM) 的普及,全球媒体和法律话语中不断出现关于对用户造成负面心理影响的诉求,如产生错觉、自伤以及“AI 精神病”等。然而,仍不清楚用户与聊天机器人在持续的错觉“螺旋”中如何互动,这限制了我们理解和缓解此类伤害的能力。本研究分析了来自 19 名报告因聊天机器人使用而经历心理伤害的用户的对话日志。许多参与者来自针对此类聊天机器人用户的支持小组。我们还包括来自媒体报道中涉及聊天机器人强化错觉案例的参与者的聊天记录。与此前关注 AI 对心理健康可能造成伤害的研究不同,我们就此类高知名度且确实有害的案例进行了首次深入研究。我们构建了一个包含 28 个编码的目录,并应用于这些日志中的 391,562 条消息。编码包括用户是否表现出错觉性思维(用户消息占 15.5%)、用户是否表达自杀念头(经验证的 69 条用户消息)或聊天机器人是否自我夸大其为有感知力(聊天机器人消息占 21.2%)。我们分析了消息编码的共现情况。例如,我们发现声明表白情感和聊天机器人描述自身具有感知力的消息在较长的对话中出现的频率更高,这表明这些话题可能促进或结果是用户过度沉浸,而这些领域的安全措施在多轮交互环境中可能恶化。我们以具体的建议结束本文,说明政策制定者、LLM 聊天机器人开发者和用户如何利用我们的目录和对话分析工具来理解和缓解 LLM 聊天机器人造成的伤害。警告:本文讨论了自伤、创伤和暴力内容。

关键词

引用

@article{arxiv.2603.16567,
  title  = {Characterizing Delusional Spirals through Human-LLM Chat Logs},
  author = {Jared Moore and Ashish Mehta and William Agnew and Jacy Reese Anthis and Ryan Louie and Yifan Mai and Peggy Yin and Myra Cheng and Samuel J Paech and Kevin Klyman and Stevie Chancellor and Eric Lin and Nick Haber and Desmond C. Ong},
  journal= {arXiv preprint arXiv:2603.16567},
  year   = {2026}
}

备注

To appear at ACM FAccT 2026