德语政治文本的意识形态预测
摘要
选举代表了一个国家持续发展过程中的关键里程碑。为了更好地理解从左翼到右翼各种运动的政治修辞,我们提出了一种基于 Transformer 的模型,能够将文本的政治取向投射到从左到右的连续光谱上,该光谱由介于 -1 和 1 之间的归一化标量 d 表示。这种方法使分析师能够专注于政治版图中的特定群体(例如保守派),同时排除自由派和极右翼运动。此类任务只能通过多类分类器实现,前提是所需的取向被纳入其预定义类别之一。为了在 13 个候选 Transformer 基础模型中确定最适合此任务的模型,我们构建了四个不同的语料库。一个语料库包含来自德国联邦议院标注过的全体会议记录,另一个基于官方在线决策工具 Wahl-O-Mat。第三个语料库由 33 家报纸的文章组成,每家报纸都由其政治取向标识;第四个包含来自第 20 届和第 21 届德国联邦议院 597 名议员的 535,200 条推文。为了减轻过拟合,我们分别使用两个不同的语料库进行训练和测试。对于领域内性能,DeBERTa-large 取得了最高的 F1 分数(F1=0.844),在 X (Twitter) 领域外测试中也表现最佳(ACC=0.864)。在报纸领域外测试中,Gemma2-2B 表现优异(MAE = 0.172)。本研究表明,Transformer 模型能够在民意调查的层面上识别德国新闻中的政治框架。我们的研究结果表明,模型架构和领域特定训练数据的可用性在估计政治偏见时可能与模型规模同样重要。我们讨论了方法论的局限性,并概述了提高偏见测量鲁棒性的方向。
引用
@article{arxiv.2605.14352,
title = {Ideology Prediction of German Political Texts},
author = {Sinclair Schneider and Florian Steuber and Joao A. G. Schneider and Gabi Dreo Rodosek},
journal= {arXiv preprint arXiv:2605.14352},
year = {2026}
}
备注
This paper has been accepted for the upcoming 20th International AAAI Conference on Web and Social Media (ICWSM 2026)