中文

SpeakGer:一个富含元数据的德国联邦与州议会语音语料库

计算与语言 2024-10-24 v1

摘要

由于能够分析单个人无法阅读的大型文本语料库,自然语言处理在政治文本和演讲中的应用在政治科学中变得越来越重要。但此类文本语料库通常缺乏关键的元信息,例如演讲者的政党、年龄或选区,这些信息可用于针对更细粒度的研究问题进行定制化分析。为使研究人员能够通过自然语言处理等定量方法回答此类问题,我们提供了 SpeakGer 数据集,该数据集包含来自德国所有 16 个联邦州以及德国联邦议院从 1947 年到 2023 年的议会辩论,共分为 10,806,105 篇演讲。该数据集包含丰富的元数据,形式包括听众对演讲的反应信息,以及演讲者的政党、年龄、选区和政党的政治倾向信息,从而能够进行更深入的分析。我们还提供了三项探索性分析,详细介绍了不同政党随时间变化的主题份额、对平均演讲者年龄发展的描述性分析,以及不同政党关于 COVID-19 大流行演讲的情感分析。

关键词

引用

@article{arxiv.2410.17886,
  title  = {SpeakGer: A meta-data enriched speech corpus of German state and federal parliaments},
  author = {Kai-Robin Lange and Carsten Jentsch},
  journal= {arXiv preprint arXiv:2410.17886},
  year   = {2024}
}

备注

10 pages, 3 figures