面向 LLM 跨文化共识的博弈论协商框架
人工智能
2025-06-17 v1 计算机与社会
计算机科学与博弈论
摘要
大型语言模型 (LLMs) 的日益普及正在影响全球价值体系。然而,由于缺乏对少数群体价值的关注,这些模型常常表现出显著的 WEIRD(西方、受过教育、工业化、富裕、民主)文化偏见。这种单一文化视角可能强化主导价值观并边缘化多元文化观点,为开发公平和包容的 AI 系统带来挑战。在本工作中,我们引入了一个系统性框架,旨在提升 LLM 之间公平且稳健的跨文化共识。我们将共识建模为纳什均衡,并采用基于策略空间响应预言机 (PSRO) 的博弈论协商方法来模拟有组织的跨文化协商过程。为评估该方法,我们利用来自世界价值观调查 (WVS) 的数据构建了区域文化智能体。除传统的模型级评估方法外,我们进一步提出了两个量化指标——基于困惑度的接受度 (Perplexity-based Acceptence) 和价值观自一致性 (Values Self-Consistency),以评估共识结果。实验结果表明,我们的方法在保证更均衡妥协的同时生成了更高质量的共识。总体而言,该方法通过公平且渐进的协商步骤引导智能体收敛,从而缓解了 WEIRD 偏见。
引用
@article{arxiv.2506.13245,
title = {A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs},
author = {Guoxi Zhang and Jiawei Chen and Tianzhuo Yang and Jiaming Ji and Yaodong Yang and Juntao Dai},
journal= {arXiv preprint arXiv:2506.13245},
year = {2025}
}