中文

向公平性迈进:缓解 LLM 中的政治偏见

计算与语言 2025-09-23 v3 人工智能

摘要

近期大型语言模型(LLM)的快速发展使其在众多实际应用中获得广泛使用。然而,这些模型倾向于编码并再现沿政治和经济维度的意识形态偏见,这仍是亟待关注的问题。本文采用一种用于探测和缓解此类偏见的框架,对 decoder-based LLM 进行分析。该方法基于 Political Compass Test(PCT),使用对比对来提取和比较来自诸如 Mistral 和 DeepSeek 等模型的隐藏层激活。我们引入了一个全面的激活提取管道,能够进行层级分析,揭示与政治表述相关的有意义差异。我们的结果表明,decoder LLM 在各层中系统性地编码了表征性偏见,这些偏见可被用于有效的驾驭向量缓解。本工作为理解 LLM 中政治偏见的编码方式提供了新见解,并提供了一种原则化的去偏方法,超越表面级的输出干预。

关键词

引用

@article{arxiv.2508.08846,
  title  = {Steering Towards Fairness: Mitigating Political Bias in LLMs},
  author = {Afrozah Nadeem and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2508.08846},
  year   = {2025}
}

备注

Accepted at CASE@RANLP2025