社会福利函数leaderboard:当 LLM 代理分配社会福利
计算与语言
2025-10-02 v1 人工智能
计算机与社会
人机交互
摘要
大型语言模型 (LLM) 正日益被信任,用于做出影响人类福祉的高风险决策。然而,指导这些模型在分配稀缺社会资源时采取的原则和价值观仍然鲜为人知。为此,我们引入了社会福利函数 (SWF) 基准,这是一个动态仿真环境,其中 LLM 充当主权分配者,将任务分配给具有异质性的受惠者社区。该基准旨在在最大化集体效率(以投资回报率 ROI 为度量)和确保分配公平性(以基尼系数为度量)之间创建持久的权衡。我们对 20 个最先进的 LLM 进行评估,并呈现了社会福利分配的首个leaderboard。我们的发现揭示了三个关键见解:(i) 模型的一般对话能力,如同流行的leaderboard所衡量的,是其分配技能的poor predictor;(ii) 大多数 LLM 表现出强烈的默认效用主义倾向,优先考虑团队生产力而牺牲严重的不平等;(iii) 分配策略高度脆弱,容易受到输出长度限制和社会影响框架的轻微扰动。这些结果凸显了将当前 LLM 部署为社会决策者的风险,强调为 AI 治理开发专门基准和针对性对齐的必要性。
引用
@article{arxiv.2510.01164,
title = {Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare},
author = {Zhengliang Shi and Ruotian Ma and Jen-tse Huang and Xinbei Ma and Xingyu Chen and Mengru Wang and Qu Yang and Yue Wang and Fanghua Ye and Ziyang Chen and Shanyi Wang and Cixing Li and Wenxuan Wang and Zhaopeng Tu and Xiaolong Li and Zhaochun Ren and Linus},
journal= {arXiv preprint arXiv:2510.01164},
year = {2025}
}