利用标签精炼从社交媒体话语构建大规模误信息标注数据集
社会与信息网络
2022-02-28 v1 计算与语言
机器学习
摘要
近期,传播误信息的恶意账号导致了广泛虚假与误导性叙事,尤其在 COVID-19 大流行期间,社交媒体平台难以快速清除这些内容。这是因为适应新领域需要耗费人力的事实核查,过程缓慢且难以扩展。为应对此挑战,我们提议将新闻来源可信度标签作为社交媒体帖子的弱标签,并提出模型引导的标签精炼以在新领域构建大规模、多样的误信息标注数据集。在文章或社交媒体帖子层面,弱标签可能不准确,因为用户立场与新闻来源或文章可信度不一致。我们提出一个框架,使用在初始弱标签上自训练的检测模型,基于模型预测熵的不确定性采样来识别潜在不准确标签,并通过自监督或重新标注予以纠正。该框架将纳入帖子所属用户社区的社交上下文,以暴露不准确标签,从而以最少人力构建大规模数据集。为提供区分误导性叙事的标注数据集(其中信息可能缺失重要上下文或含有不准确附属细节),所提框架将使用少量标注样本作为类原型,将高置信样本划分为虚假、未证实、混合、大多虚假、大多真实、真实与辟谣信息。该方法被演示用于提供关于 COVID-19 疫苗的大规模误信息数据集。
引用
@article{arxiv.2202.12413,
title = {Construction of Large-Scale Misinformation Labeled Datasets from Social Media Discourse using Label Refinement},
author = {Karishma Sharma and Emilio Ferrara and Yan Liu},
journal= {arXiv preprint arXiv:2202.12413},
year = {2022}
}