中文

解构大语言模型观点动力学中的交互与偏差效应

物理与社会 2026-05-25 v2 人工智能 适应与自组织系统

摘要

大语言模型(Large Language Models, LLMs)越来越多地被用于模拟人类观点动力学,然而真实交互的效果常常被系统性偏差所掩盖。我们开发了一个贝叶斯框架来解构并量化三种此类偏差:(i)倾向于LLM默认立场的主题偏差;(ii)无论问题如何,都倾向于同意提示陈述的同意偏差;(iii)倾向于发起代理立场的锚定偏差。我们将此框架应用于多种LLM,这些LLM就气候变化、社会正义到音乐偏好等12个不同问题进行了多步对话。我们发现,观点轨迹倾向于快速收敛到一个共享的吸引子,交互和偏差的影响都随时间衰减,并且偏差的影响在不同LLM之间存在差异。此外,我们表明,在不同强烈观点陈述(包括错误信息)的数据集上微调LLM,会相应地改变观点吸引子。通过揭示LLM之间的显著差异,并提供量化工具来比较LLM代理讨论中交互和偏差对观点转变的贡献,我们的方法突显了使用LLM作为人类行为代理的前景与陷阱。

关键词

引用

@article{arxiv.2509.06858,
  title  = {Disentangling Interaction and Bias Effects in Opinion Dynamics of Large Language Models},
  author = {Vincent C. Brockers and David A. Ehrlich and Viola Priesemann},
  journal= {arXiv preprint arXiv:2509.06858},
  year   = {2026}
}