Twitter立场检测多语言数据集的半自动生成
计算与语言
2021-01-29 v1
摘要
流行的社交媒体网络为研究用户表达的观点与态度提供了理想环境。尽管诸如Twitter的社交媒体中的交互以多种自然语言发生,自然语言处理领域内的立场检测(针对特定话题表达的位置或态度)研究主要在英语上进行。尽管近期已作出一些努力以开发其他语言的标注数据,但明显缺乏促进立场检测多语言与跨语言研究的资源。这部分由于手动标注社交媒体文本语料库是一个困难、缓慢且昂贵的过程。此外,由于立场是一种高度依赖领域与话题的现象,对标注数据的需求尤为迫切。结果,大多数手动标注资源受其相对小规模与偏斜类别分布的限制。本文提出一种获取Twitter立场检测多语言数据集的方法。我们不直接逐条手动标注推文,而是利用基于用户的信息半自动地标注大量推文。单语言与跨语言的实证实验及定性分析表明,我们的方法有助于克服上述构建大规模、平衡且多语言标注语料的困难。我们相信该方法可轻易调整以生成其他自然语言处理任务与领域的标注社交媒体数据。
引用
@article{arxiv.2101.11978,
title = {Semi-automatic Generation of Multilingual Datasets for Stance Detection in Twitter},
author = {Elena Zotova and Rodrigo Agerri and German Rigau},
journal= {arXiv preprint arXiv:2101.11978},
year = {2021}
}
备注
Stance detection, multilingualism, text categorization, fake news, deep learning