中文

勿改我见:大语言模型中的意识形态偏见审计

计算与语言 2025-09-17 v1 人工智能

摘要

随着大语言模型(LLMs)日益嵌入数百万用户使用的产品中,其输出可能影响个体信念,并累积性地塑造公众舆论。如果LLMs的行为可以被有意地导向特定的意识形态立场,例如政治或宗教观点,那么控制这些系统的人就可能获得对公共话语不成比例的影响力。尽管LLMs能否被可靠地引导至连贯的意识形态立场,以及这种引导能否被有效阻止,仍然是一个悬而未决的问题,但关键的第一步是开发出检测此类引导企图何时发生的方法。在这项工作中,我们将一种先前提出的统计方法应用于意识形态偏见审计的新情境。我们的方法沿用了原始框架的模型无关设计,该设计无需访问语言模型的内部结构。相反,它通过分析与选定主题相关的提示下模型输出的分布偏移来识别潜在的意识形态引导。这种设计使得该方法特别适用于审计专有的黑箱系统。我们通过一系列实验验证了我们的方法,展示了其实际适用性及其支持对LLM行为进行独立事后审计的潜力。

关键词

引用

@article{arxiv.2509.12652,
  title  = {Don't Change My View: Ideological Bias Auditing in Large Language Models},
  author = {Paul Kröger and Emilio Barkett},
  journal= {arXiv preprint arXiv:2509.12652},
  year   = {2025}
}