中文

评估大型语言模型在多语言国家偏见中的代理能力

计算与语言 2025-08-07 v2

摘要

大型语言模型因其在多语言自然语言处理方面的能力而备受关注,而针对跨语言偏见的研究则仅限于即时上下文偏好。跨语言推理能力在基于决策的推荐方面的差异鲜少被探讨,甚至缺乏描述性分析。本研究是首次针对这一空白进行工作。我们测试了LLM在三个关键场景——大学申请、旅行和搬迁——中提供个性化建议的适用性和能力。我们通过分析跨多语言的决策任务响应,检验最先进LLM在多语言偏见方面的表现。我们量化了模型生成评分中的偏见,并评估了人口统计因素和推理策略(如链式思考提示)对偏见模式的影响。我们的发现表明,不同任务中都存在本地语言偏见,GPT-4和Sonnet相较于GPT-3.5在减少英文国家的偏见方面有所改进,但未实现稳健的多语言对齐,凸显了面向多语言AI代理及其应用(如教育)的更广泛含义。\footnote{代码可在:https://github.com/yiyunya/assess_agentic_national_bias 获取}

关键词

引用

@article{arxiv.2502.17945,
  title  = {Assessing Agentic Large Language Models in Multilingual National Bias},
  author = {Qianying Liu and Katrina Qiyao Wang and Fei Cheng and Sadao Kurohashi},
  journal= {arXiv preprint arXiv:2502.17945},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings. 14 pages