中文

LLM(真的)具有意识形态吗?基于 IRT 的 LLM 感知社会经济偏见分析与对齐工具

人工智能 2025-03-18 v1 计算与语言 计算机与社会

摘要

我们引入了一个基于项目反应理论(IRT)的框架,用于检测和量化大型语言模型(LLM)中的社会经济偏见,而无需依赖主观的人类判断。与传统方法不同,IRT 考虑了项目难度,从而改善了意识形态偏见估计。我们对两个 LLM 家族(Meta-LLaMa 3.2-1B-Instruct 和 Chat-GPT 3.5)进行微调以代表不同的意识形态立场,并引入一种两阶段方法:(1) 对回答回避进行建模,以及 (2) 估计已回答响应中的感知偏见。我们的结果表明,现成的 LLM 通常回避意识形态参与而非表现出偏见,这挑战了先前关于党派性的主张。这一经过实证验证的框架增强了 AI 对齐研究并促进了更公平的 AI 治理。

关键词

引用

@article{arxiv.2503.13149,
  title  = {Are LLMs (Really) Ideological? An IRT-based Analysis and Alignment Tool for Perceived Socio-Economic Bias in LLMs},
  author = {Jasmin Wachter and Michael Radloff and Maja Smolej and Katharina Kinder-Kurlanda},
  journal= {arXiv preprint arXiv:2503.13149},
  year   = {2025}
}