中文

面向政治学的 LLM 基准测试:联合国视角

计算与语言 2026-01-26 v2 计算机与社会 新兴技术

摘要

大语言模型 (LLM) 在自然语言处理领域取得了显著进展,但其在高风险政治决策中的潜力仍基本未被探索。本文致力于填补这一空白,聚焦于将大语言模型应用于联合国 (UN) 决策过程的应用,其中决策风险极高,政治决策可能产生深远影响。我们引入了一个新型数据集,包含 1994 年至 2024 年期间公开的联合国安理会 (UNSC) 记录,包括草案决议、投票记录和外交演讲。基于该数据集,我们提出了联合国基准 (UNBench),第一个全面评估大语言模型在四个相互关联的政治学任务上的能力的基准:共同持有人判断、代表性投票模拟、草案通过预测和代表性陈述生成。这些任务涵盖了联合国决策过程的三个阶段:起草、投票和讨论,旨在评估大语言模型理解和模拟政治动态的能力。我们的实验分析展示了大语言模型在该领域潜力与挑战,提供了对其在政治学中优势与局限性的见解。该工作促进了人工智能与政治学交叉领域的发展,为全球治理的研究和实际应用开辟了新方向。UNBench 数据仓库可访问地址为:https://github.com/yueqingliang1/UNBench。

关键词

引用

@article{arxiv.2502.14122,
  title  = {Benchmarking LLMs for Political Science: A United Nations Perspective},
  author = {Yueqing Liang and Liangwei Yang and Chen Wang and Congying Xia and Rui Meng and Xiongxiao Xu and Haoran Wang and Ali Payani and Kai Shu},
  journal= {arXiv preprint arXiv:2502.14122},
  year   = {2026}
}

备注

This paper has been accepted at AAAI 2026 as an oral paper