中文

评估大型语言模型全球文化视角的基准测试——WorldView-Bench

计算与语言 2025-05-15 v1 人工智能 计算机与社会 多智能体系统

摘要

大型语言模型(LLM)主要通过强化西方主义认识论和社会文化规范的训练和对齐,导致文化同质化,限制了其反映全球文明多样性的能力。现有的基准测试框架未能充分捕捉这种偏见,因为它们依赖刚性、封闭形式的评估,忽视了文化包容性的复杂性。为此,我们提出WorldView-Bench(世界视角基准测试),一种旨在评估大型语言模型全球文化包容性(GCI)的基准测试,通过分析其容纳多元世界view的能力。我们的ethods grounded于Senturk等人提出的多重世界view(Multiplex Worldview),区分强化文化同质化的单一世界view(Uniplex)模型和整合多元视角的多重世界view(Multiplex)模型。WorldView-Bench通过自由形式的生成式评估来衡量文化极化——即排除替代视角的程度,而非传统的分类性基准测试。我们通过两种干预策略实现多重性:(1)上下文实现的多重语言模型(Contextually-Implemented Multiplex LLMs),其中系统提示嵌入多重性原则;(2)多智能体系统(MAS)实现的多重语言模型(MAS-Implemented Multiplex LLMs),其中代表不同文化视角的多个语言模型代理共同生成响应。我们的结果表明,随着MAS实现的多重语言模型将PDS(Perspectives Distribution Score,视角分布得分)熵从基线的13%显著提升至94%,并呈现出积极情感(67.7%)和增强的文化平衡。这些发现凸显了多重感知AI评估在缓解大型语言模型文化偏见方面的潜力,为构建更具包容性和伦理导向的AI系统铺平了道路。

关键词

引用

@article{arxiv.2505.09595,
  title  = {WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models},
  author = {Abdullah Mushtaq and Imran Taj and Rafay Naeem and Ibrahim Ghaznavi and Junaid Qadir},
  journal= {arXiv preprint arXiv:2505.09595},
  year   = {2025}
}

备注

Preprint. Submitted to the Journal of Artificial Intelligence Research (JAIR) on April 29, 2025