基于 21 语种平行 EuroParl 数据集评估多语言 LLM 的政治公平性
计算与语言
2026-03-12 v2
摘要
大型语言模型(LLM)的政治偏见通常通过模拟其对英文调查的回答来评估。在本工作中,我们提出了一种基于多语言翻译公平性原则的替代性偏见评估框架。我们系统比较了欧洲议会(EP)中演讲的翻译质量,观察到左派和右派主要政党的翻译优于外围政党。这一研究得以实现,归功于新的 21 语种平行版本的 EuroParl 数据集,即 EP 的议会程序记录,其中包含每位发言者的政治派系信息。数据集包含 150 万句话,总计 4000 万字,2490 万字符。它覆盖三年,1000 多位演讲者,7 个国家,12 个欧盟政党,25 个欧盟委员会以及数百个国家政党。
引用
@article{arxiv.2510.20508,
title = {Assessing the Political Fairness of Multilingual LLMs: A Case Study based on a 21-way Multiparallel EuroParl Dataset},
author = {Paul Lerner and François Yvon},
journal= {arXiv preprint arXiv:2510.20508},
year = {2026}
}
备注
Accepted at LREC 2026. Added results with new models and two-ANOVA. Same conclusions