中文

RooseBERT:为政治语言建模提供新的解决方案

计算与语言 2026-02-25 v3 人工智能

摘要

政治辩论和政治相关讨论的数量不断增加,呼 necessitating 为自动分析此类内容的新型计算方法的定义,以最终目标是减轻公众参与政治讨论的负担。然而,政治语言的特殊性以及这些辩论中隐含的通信策略和潜在论点的运用,使得即使是当前通用型预训练语言模型(LM)也难以实现这一任务。为此,我们引入了用于政治话语语言建模的新型预训练语言模型RooseBERT。对特定领域进行预训练存在不同的技术和语言挑战,需要大量计算资源和大规模数据。RooseBERT是在11GB的英文政治辩论和演说语料库上进行预训练的。为评估其性能,我们在与政治辩论分析相关的多个下游任务上微调了它,即立场检测、情感分析、论证成分检测与分类、论证关系预测与分类、政策分类、命名实体识别(NER)。我们的结果显示,在多数这些任务上,RooseBERT相对于通用型语言模型实现了显著的改进,凸显了领域特定预训练如何增强政治辩论分析中的性能。我们为研究社区发布RooseBERT。

关键词

引用

@article{arxiv.2508.03250,
  title  = {RooseBERT: A New Deal For Political Language Modelling},
  author = {Deborah Dore and Elena Cabrio and Serena Villata},
  journal= {arXiv preprint arXiv:2508.03250},
  year   = {2026}
}