中文

越过边界的偏见:多语言 LLM 中的政治意识形态评估与引导

计算与语言 2026-02-12 v3 人工智能

摘要

大型语言模型(LLM)日益塑造全球话语,使公平性和意识形态中性对于负责任的 AI 部署至关重要。尽管对 LLM 政治偏见的关注日益增长,但先前工作主要关注高资源、西方语言或狭窄的多语言环境,留下了跨语言一致性和安全后处理缓解问题的探索空间不足。为弥补这一差距,我们提出了覆盖 50 个国家和 33 种语言的大规模多语言政治偏见评估。我们引入一种互补的后处理缓解框架——跨语言一致性引导(Cross-Lingual Alignment Steering, CLAS),旨在通过在语言之间对齐意识形态表征并动态调节干预强度来增强现有引导方法。该方法将由政治提示诱导的潜在意识形态表征对齐到共享意识形态子空间中,以确保跨语言一致性,同时自适应机制可防止过度校正并保持连贯性。实验表明,该方法在经济和社会两个轴向上显著减少偏见,并在保持回复质量的同时实现最小退化。该框架建立了一种可扩展且可解释的公平性感知多语言 LLM 治理范式,平衡了意识形态中性与语言和文化多样性。

关键词

引用

@article{arxiv.2601.23001,
  title  = {Bias Beyond Borders: Political Ideology Evaluation and Steering in Multilingual LLMs},
  author = {Afrozah Nadeem and Agrima Seth and Mehwish Nasim and Usman Naseem},
  journal= {arXiv preprint arXiv:2601.23001},
  year   = {2026}
}

备注

PrePrint