ParlaSent:用于议会 proceedings 中情感识别的多语言训练数据集
计算与语言
2024-03-21 v2
摘要
本文提出了一个包含 7 种语言、经人工标注情感的新训练数据集,该数据集用于一系列聚焦于训练稳健的议会 proceedings 情感识别器的实验。本文还引入了首个面向政治学应用的领域特定多语言 transformer 语言模型,该模型在来自 27 个欧洲议会的 17.2 亿词上进行了额外预训练。我们展示了实验,证明在议会数据上的额外预训练可显著提升模型下游性能,在我们的案例中即议会 proceedings 中的情感识别。我们进一步表明,我们的多语言模型在微调阶段未见过的语言上表现非常好,且来自其他语言的额外微调数据显著改善了目标议会的结果。本文对社会科学内部多个学科做出了重要贡献,并将其与计算机科学和计算语言学相桥接。最后,所得微调语言模型为跨语言政治文本情感分析建立了更稳健的方法,使学者能够使用标准化工具和技术从比较视角研究政治情感。
引用
@article{arxiv.2309.09783,
title = {The ParlaSent Multilingual Training Dataset for Sentiment Identification in Parliamentary Proceedings},
author = {Michal Mochtak and Peter Rupnik and Nikola Ljubešić},
journal= {arXiv preprint arXiv:2309.09783},
year = {2024}
}