中文

LLM 训练前与训练后数据中的政治内容是什么?

计算与语言 2026-04-06 v2 人工智能 计算机与社会

摘要

已知大语言模型(LLM)会生成带有政治偏见的文本。然而,目前尚不清楚这种偏见是如何产生的,这使得设计有效的缓解策略变得困难。我们假设这些偏见根源于训练数据的构成。以数据为中心的视角出发,我们提出了以下研究问题:(1)数据中存在的政治倾向,(2)数据不平衡,(3)跨数据集相似性,以及(4)数据-模型对齐。随后,我们考察了接触政治内容与模型在政策问题上的立场之间的关系。我们结合大规模采样、政治倾向分类和立场检测,分析了开源 LLM 训练前与训练后数据集的政治内容。我们发现,训练数据系统性地偏向左倾内容,且训练前语料库中包含的政治参与性材料远多于训练后数据。我们进一步观察到,训练数据中的政治立场与模型行为之间存在强相关性,并表明尽管策展策略不同,训练前数据集仍展现出相似的政治分布。此外,我们发现政治偏见在基础模型中已经存在,并贯穿训练后各个阶段持续存在。这些发现突显了数据构成在塑造模型行为中的核心作用,并凸显了提高数据透明度的必要性。

关键词

引用

@article{arxiv.2509.22367,
  title  = {What Is The Political Content in LLMs' Pre- and Post-Training Data?},
  author = {Tanise Ceron and Dmitry Nikolaev and Dominik Stammbach and Debora Nozza},
  journal= {arXiv preprint arXiv:2509.22367},
  year   = {2026}
}

备注

10 pages, under review