中文

面向计算语言学与政治分析的希腊议会会议数据集

计算与语言 2022-10-25 v1 人工智能

摘要

政治话语的大型历时性数据集很难获取,尤其是对于希腊语这类资源匮乏的语言。在本文中,我们介绍了一个精心整理的希腊议会会议数据集,其时间跨度从1989年延伸至2020年。该数据集由从5,355个议会记录文件中提取的超过100万篇演讲及其丰富的元数据组成。我们解释了其构建方式以及我们不得不克服的挑战。该数据集可用于计算语言学和政治分析——理想情况下,将二者结合。我们展示了这样一个应用,表明(i)如何使用该数据集研究词用法随时间的变迁,(ii)在重大历史事件与政党之间,(iii)通过评估并采用检测语义漂移的算法。

关键词

引用

@article{arxiv.2210.12883,
  title  = {A Greek Parliament Proceedings Dataset for Computational Linguistics and Political Analysis},
  author = {Konstantina Dritsa and Kaiti Thoma and John Pavlopoulos and Panos Louridas},
  journal= {arXiv preprint arXiv:2210.12883},
  year   = {2022}
}

备注

Accepted to the 36th Conference on Neural Information Processing Systems (NeurIPS 2022) Track on Datasets and Benchmarks