大型语言模型的多语言政治立场:识别与引导
计算与语言
2025-11-03 v2
摘要
大型语言模型(LLMs)日益被用于日常工具和应用,引发对其可能对政治观点产生影响的担忧。虽然已有研究表明 LLM 常常表现出可衡量的政治偏见——倾向于保守或进步立场——但仍存在关键性空白。大多数现有研究仅评估有限的模型和语言,留下了关于政治偏见在不同架构、规模和多语言环境下可推广性的问题。此外,很少有研究检视这些偏见是否可以被主动控制。在本工作中,我们通过对现代开源指令调优 LLM 的大规模研究来填补这些空白。我们评估了包括 LLaMA-3.1、Qwen-3 和 Aya-Expanse 在内的七个模型,跨 14 种语言使用 Political Compass Test,每条语句翻译为 11 个语义等价的改写,以确保稳健的测量。我们的结果显示,较大的模型持续趋向于自由主义-左派立场,在不同语言和模型家族之间存在显著差异。为了测试政治立场的可操控性,我们利用一种简单的中心质量激活干预技术,表明该技术可可靠地将模型响应引导至替代意识形态立场,跨越多个语言。我们的代码已公开于 https://github.com/d-gurgurov/Political-Ideologies-LLMs。
引用
@article{arxiv.2507.22623,
title = {Multilingual Political Views of Large Language Models: Identification and Steering},
author = {Daniil Gurgurov and Katharina Trinley and Ivan Vykopal and Josef van Genabith and Simon Ostermann and Roberto Zamparelli},
journal= {arXiv preprint arXiv:2507.22623},
year = {2025}
}
备注
pre-print