中文

大语言模型的政治偏好

计算机与社会 2024-06-04 v2 人工智能 计算与语言

摘要

我在此报告一项关于大语言模型(LLM)中嵌入的政治偏好的全面分析。具体而言,我对24个最先进的对话式LLM(包括闭源和开源)进行了11项政治倾向测试,这些测试旨在识别受试者的政治偏好。当用带有政治含义的问题/陈述进行探测时,大多数对话式LLM倾向于生成被大多数政治测试工具诊断为表现出左倾观点的回应。对于另外五个基础(即基座)模型(优化用于人类对话的LLM构建于其上),情况似乎并非如此。然而,基础模型在连贯回答测试问题方面的表现较弱,使得这一子集的结果不确定。最后,我证明通过监督微调(SFT)仅使用适量的政治对齐数据,就可以将LLM引导至政治光谱中的特定位置,这表明SFT具有将政治取向嵌入LLM的潜力。随着LLM开始部分取代搜索引擎和维基百科等传统信息来源,嵌入LLM中的政治偏见的社会影响是巨大的。

关键词

引用

@article{arxiv.2402.01789,
  title  = {The Political Preferences of LLMs},
  author = {David Rozado},
  journal= {arXiv preprint arXiv:2402.01789},
  year   = {2024}
}