回复与引用中的立场(SRQ):用于学习Twitter对话中立场的新数据集
计算与语言
2020-06-30 v2 机器学习
摘要
从社交媒体对话中自动提取立场(否认与支持观点)对于推进观点挖掘研究至关重要。近来,随着新模型试图改进当前最优(state-of-the-art)水平,该领域再度焕发生机。然而,用于训练和评估这些模型的数据集往往规模较小。此外,这些小型数据集的类别分布不均,即数据集中仅有极小比例的样本具有支持或否认立场,而大多数其他样本无明显立场。而且,现有数据集未区分社交媒体上不同类型的对话(例如Twitter上的回复与引用)。因此,在某一事件上训练的模型无法泛化到其他事件。在本文工作中,我们通过标注Twitter上有争议议题下对推文(包括回复与引用)的回应中的立场,构建了一个新数据集。据我们所知,这是目前最大的带人工标注立场的Twitter对话数据集,包含超过5200个立场标签。更重要的是,我们设计了一种推文收集方法,倾向于选择否认型回应。该类在谣言识别和确定用户间对抗关系方面预期更具用处。此外,我们包含了许多用于学习对话中立场的基线模型,并比较了各类模型的性能。我们表明,结合回复与引用的数据会降低模型准确率,说明这两种模态在立场学习上的表现不同。
引用
@article{arxiv.2006.00691,
title = {Stance in Replies and Quotes (SRQ): A New Dataset For Learning Stance in Twitter Conversations},
author = {Ramon Villa-Cox and Sumeet Kumar and Matthew Babcock and Kathleen M. Carley},
journal= {arXiv preprint arXiv:2006.00691},
year = {2020}
}