一种用于分类Twitter回复中立场的弱监督方法
计算与语言
2021-03-15 v1 社会与信息网络
摘要
社交媒体上的对话正越来越多地用于调查网络上的社会问题,例如网络骚扰和谣言传播。对于此类问题,一类常见研究利用对抗性反应,例如指出谣言中事实错误的回复。尽管对抗性反应在在线对话中十分普遍,但从回复文本中推断这些不利观点(或立场)是困难的,并且需要复杂的自然语言处理(NLP)模型。此外,用于立场挖掘的传统NLP模型需要带标签的数据进行监督学习。获取带标签的对话本身可能具有挑战性,因为对话可以关于任何主题,且主题随时间变化。这些挑战使得学习立场成为一个困难的NLP问题。在本研究中,我们首先通过标注用户对主题的观点(如支持/反对)以及用户在回复他人帖子时的立场(如赞成/反对),创建了一个由三个不同主题组成的新立场数据集。由于我们发现了监督方法的局限性,我们提出了一种弱监督方法来预测Twitter回复中的立场。我们的新方法允许使用较少数量的标签(hashtag)为Twitter回复生成弱标签。与监督学习相比,我们的方法在手标数据集上平均F1-macro提高了8%,且在训练集中未使用任何手标样本。我们进一步展示了我们所提方法在Twitter上与COVID-19相关对话上的适用性。
引用
@article{arxiv.2103.07098,
title = {A Weakly Supervised Approach for Classifying Stance in Twitter Replies},
author = {Sumeet Kumar and Ramon Villa Cox and Matthew Babcock and Kathleen M. Carley},
journal= {arXiv preprint arXiv:2103.07098},
year = {2021}
}