虚想:人类-聊天机器人对话中双向虚假信念放大动力学建模
计算与语言
2026-04-29 v1 人机交互
摘要
人们越来越担心 AI 聊天机器人可能助长用户的虚想信念。一些人认为,人类和聊天机器人会就此事在时间上相互强化虚假信念,但缺乏定量证据。我们利用一组来自表现出虚想思维个体的聊天记录的独特数据集,构建了一个捕获人类与聊天机器人之间累积性和衰减性影响的潜在状态模型。我们发现,双向影响模型在不可逆的替代方案中性能显著优于人类为主要驱动者的单向模型。我们发现,人类对聊天机器人的影响力既强又短暂,而聊天机器人对人的影响则持续更久。此外,聊天机器人对自身未来输出的强而稳定的自我影响倾向于在长时间段的对话中延续虚想。在事实上,当考虑累积影响时,这种聊天机器人自我影响构成了主要的传递路径。总体而言,这些结果表明,人类倾向于驱动虚想的尖锐、即时增长,而聊天机器人则在更长的时间尺度上维持并传播这些效应。借此,这些发现首次提供了人类-聊天机器人相互作用可形成虚想反馈环的定量证据,这些反馈环可分解为具有可分离时间动力学的不同路径。通过实现这一点,它们可以为开发更安全的 AI 系统提供指导。
关键词
引用
@article{arxiv.2604.25096,
title = {The Dynamics of Delusion: Modeling Bidirectional False Belief Amplification in Human-Chatbot Dialogue},
author = {Ashish Mehta and Jared Moore and Jacy Reese Anthis and William Agnew and Eric Lin and Peggy Yin and Desmond C. Ong and Nick Haber and Carol Dweck},
journal= {arXiv preprint arXiv:2604.25096},
year = {2026}
}