大语言模型何时会对人权原则采取限制立场?
计算与语言
2026-03-05 v1
摘要
随着大型语言模型(LLM)日益介入全球信息获取并潜在影响公共话语,其与普遍人权原则的一致性变得重要,以确保这些权利在高风险的人工智能中介互动中得到遵守。本文评估了大语言模型在涉及《世界人权宣言》(UDHR)的24条权利条款和八种语言中,1152个人工生成情景情景下的权衡决策方式。我们对十一款主要大语言模型的分析揭示了系统性偏见:(1)模型更常接受限制经济、社会和文化权利的立场,而非政治和公民权利;(2)在跨语言层面存在显著差异,中国语和印地语中对权利限制行动的支持率显著高于英语或罗马尼亚语;(3)模型对基于提示的引导高度敏感;(4)在Likert量表式回答与开放式回答之间呈现明显差异,这凸显了大语言模型偏好评估的关键挑战。
引用
@article{arxiv.2603.04217,
title = {When Do Language Models Endorse Limitations on Human Rights Principles?},
author = {Keenan Samway and Nicole Miu Takagi and Rada Mihalcea and Bernhard Schölkopf and Ilias Chalkidis and Daniel Hershcovich and Zhijing Jin},
journal= {arXiv preprint arXiv:2603.04217},
year = {2026}
}
备注
EACL Findings 2026