基于层次联合分解的半监督多维度错误信息检测
社会与信息网络
2021-06-07 v2 机器学习
机器学习
摘要
在当今世界互联的背景下,区分错误信息与真实信息是最具挑战性的问题之一。绝大多数最先进的错误信息检测方法都是全监督的,需要大量高质量的标注。然而,此类标注的可用性并非理所当然,因为以跟上错误信息扩散的方式来进行标注成本高昂、耗时且困难。在本工作中,我们关注标注数量有限的场景。在此类场景中,我们探究如何利用刻画一篇新闻文章的多种不同资源(以下称为“维度”)来弥补标签的缺失。具体而言,本文的贡献有两点:1) 我们提出使用三种不同维度:文章内容、社交分享行为上下文,以及宿主网站/域名特征;2) 我们引入了一个基于张量的原则性嵌入框架,可有效结合所有上述维度。我们提出 HiJoD,一个两级分解流程,不仅在 Twitter 和 Politifact 数据集上分别以 74% 和 81% 的 F1 分数优于当前最优方法,而且比类似的集成方法快一个数量级。
引用
@article{arxiv.2005.04310,
title = {Semi-Supervised Multi-aspect Detection of Misinformation using Hierarchical Joint Decomposition},
author = {Sara Abdali and Neil Shah and Evangelos E. Papalexakis},
journal= {arXiv preprint arXiv:2005.04310},
year = {2021}
}