中文

大语言模型是否具有社会适应性?大语言模型与人类信念演化的对比

计算工程、金融与科学 2026-05-29 v3 人工智能

摘要

随着大语言模型(LLM)越来越多地参与复杂的社会互动,确保其行为符合人类伦理原则和意图(即价值对齐)已成为一个关键的科学挑战。现有的基准测试通常依赖静态评估,无法捕捉决策的纵向动态或驱动智能体行为的潜在认知过程。在这项工作中,我们提出了 FairMindSim,一个基于社会心理学的现实模拟基准,通过连续经济博弈来评估对齐。为了超越黑箱观察,我们引入了信念-奖励对齐行为演化模型(BREM),这是一个将决策形式化为在最大化外在奖励与维护内在信念之间动态权衡的概率框架。我们进行了一项涉及 1017 名人类参与者和 10 个 LLM(包括 GPT-5 和 Gemini-3-Pro)的大规模比较研究。我们的实验结果揭示了第三方惩罚(TPP)博弈中一个与能力相关的非线性经验趋势。中等能力的模型表现出僵化且具有攻击性的算法行为,其特征是过度惩罚,而前沿模型则随着推理能力的扩展,表现出向宽容和类人宽大处理的收敛。此外,利用 BREM,我们分解了智能体的纵向决策动态,发现更先进的模型能更好地平衡冲突目标,减少信念-行为不一致性。我们的贡献提供了一个用于心理压力测试的标准化协议,以及一个用于分析受控社会困境中 AI 对齐纵向演化的可解释机制。

关键词

引用

@article{arxiv.2410.10398,
  title  = {Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans},
  author = {Yu Lei and Hao Liu and Chengxing Xie and Songjia Liu and Zhiyu Yin and Canyu Chen and Guohao Li and Philip Torr and Zhen Wu},
  journal= {arXiv preprint arXiv:2410.10398},
  year   = {2026}
}

备注

KDD 2026 Oral