中文

多语言立场检测:加泰罗尼亚独立语料库

计算与语言 2020-04-02 v1

摘要

立场检测旨在确定给定文本针对特定话题或主张的态度。尽管近年来立场检测已得到相当充分的研究,但多数工作聚焦于英语。这主要源于其他语言标注数据的相对匮乏。IberEval 2018 发布的 TW-10 公投数据集是为加泰罗尼亚语和西班牙语提供多语言立场标注数据的早期尝试。遗憾的是,TW-10 的加泰罗尼亚语子集极度不平衡。本文通过呈现一个针对加泰罗尼亚语和西班牙语的推特多语言立场检测新数据集来解决这些问题,旨在促进多语言与跨语言设定下的立场检测研究。该数据集标注了针对某一话题——即加泰罗尼亚独立——的立场。我们还提供了一种基于推特用户分类的半自动数据集标注方法。我们在新语料库上尝试了若干监督方法,包括线性分类器与深度学习方法。将我们的新语料库与 TW-10 数据集对比,显示了平衡良好的语料库在多语言与跨语言立场检测研究中的益处与潜力。最后,我们在 TW-10 数据集上(加泰罗尼亚语与西班牙语)确立了新的最优结果。

关键词

引用

@article{arxiv.2004.00050,
  title  = {Multilingual Stance Detection: The Catalonia Independence Corpus},
  author = {Elena Zotova and Rodrigo Agerri and Manuel Nuñez and German Rigau},
  journal= {arXiv preprint arXiv:2004.00050},
  year   = {2020}
}

备注

Accepted at LREC 2020; 8 pages 10 tables