掩蔽还是镜像:集体推理中的人机对齐
人工智能
2025-10-03 v1 多智能体系统
摘要
随着大语言模型(LLM)日益被用于建模和增强集体决策,审视其与人类社会推理的对齐程度变得至关重要。与先前个体层面的研究不同,我们提出了一个用于评估集体对齐的实证框架。利用“海上漂流”(Lost at Sea)社会心理学任务,我们进行了一项大规模在线实验(N=748),将各组随机分配至具有可见人口统计学属性(如姓名、性别)或使用化名的领导者选举中。随后,我们基于人类数据模拟匹配的 LLM 群体,对 Gemini 2.5、GPT 4.1、Claude Haiku 3.5 和 Gemma 3 进行基准测试。LLM 的行为出现分化:部分模型镜像人类的偏见,另一些则掩蔽这些偏见并试图予以补偿。我们实证表明,集体推理中的人机对齐取决于上下文、线索以及模型特定的归纳偏置。理解 LLM 如何与集体人类行为对齐对于推进社会对齐的 AI 至关重要,这需要能够捕捉集体推理复杂性的动态基准测试。
引用
@article{arxiv.2510.01924,
title = {To Mask or to Mirror: Human-AI Alignment in Collective Reasoning},
author = {Crystal Qian and Aaron Parisi and Clémentine Bouleau and Vivian Tsai and Maël Lebreton and Lucas Dixon},
journal= {arXiv preprint arXiv:2510.01924},
year = {2025}
}