LLM(真的)具有意识形态吗?基于 IRT 的 LLM 感知社会经济偏见分析与对齐工具
人工智能
2025-03-18 v1 计算与语言
计算机与社会
摘要
我们引入了一个基于项目反应理论(IRT)的框架,用于检测和量化大型语言模型(LLM)中的社会经济偏见,而无需依赖主观的人类判断。与传统方法不同,IRT 考虑了项目难度,从而改善了意识形态偏见估计。我们对两个 LLM 家族(Meta-LLaMa 3.2-1B-Instruct 和 Chat-GPT 3.5)进行微调以代表不同的意识形态立场,并引入一种两阶段方法:(1) 对回答回避进行建模,以及 (2) 估计已回答响应中的感知偏见。我们的结果表明,现成的 LLM 通常回避意识形态参与而非表现出偏见,这挑战了先前关于党派性的主张。这一经过实证验证的框架增强了 AI 对齐研究并促进了更公平的 AI 治理。
引用
@article{arxiv.2503.13149,
title = {Are LLMs (Really) Ideological? An IRT-based Analysis and Alignment Tool for Perceived Socio-Economic Bias in LLMs},
author = {Jasmin Wachter and Michael Radloff and Maja Smolej and Katharina Kinder-Kurlanda},
journal= {arXiv preprint arXiv:2503.13149},
year = {2025}
}