基于远程网络监督的半监督推文立场检测
社会与信息网络
2022-01-06 v2 计算与语言
机器学习
摘要
在社交媒体文本中检测和标注立场,受到仇恨言论检测、民调预测、参与度预测和有组织宣传检测的强烈驱动。当今最优的神经立场检测器需要大量训练数据,而鉴于社交媒体文本及其用户发表意见的话题快速更迭,这些数据难以整理。社交网络上的同质性(homophily)特性为粗粒度用户级立场提供了强信号。但用于推文级立场检测的半监督方法未能妥善利用同质性。有鉴于此,我们提出 SANDS,一种新型半监督立场检测器。SANDS 从极少量标注推文出发,构建推文的多个深度特征视图,并利用来自社交网络的远程监督信号为组件学习器提供替代损失信号。我们准备了两个新推文数据集,包含来自两个人群(美国和印度)、由超过 87,000 名用户发布的 236,000 余条具有政治色彩的推文、其关注-被关注图,以及由语言学家标注的 8,000 余条推文。SANDS 在基于美国(印度)的数据集上取得了 0.55(0.49)的宏 F1 分数,大幅优于 17 个基线(含 SANDS 变体),尤其在少数立场标签和噪声文本上表现突出。对 SANDS 的大量消融实验厘清了文本与网络传播立场信号的动态关系。
引用
@article{arxiv.2201.00614,
title = {Semi-supervised Stance Detection of Tweets Via Distant Network Supervision},
author = {Subhabrata Dutta and Samiya Caur and Soumen Chakrabarti and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2201.00614},
year = {2022}
}