中文

TIMME:基于多任务多关系嵌入的Twitter意识形态检测

机器学习 2020-06-19 v3 机器学习

摘要

我们旨在解决预测人们意识形态或政治倾向的问题。我们使用Twitter数据对其进行估计,并将其形式化为一个分类问题。意识形态检测长期以来一直是一个具有挑战性却又重要的问题。特定群体,例如政策制定者,依赖它来做出明智的决策。在过去,需要进行劳动密集型的调查研究来收集公众意见,分析普通公民的政治倾向十分困难。诸如Twitter等社交媒体的兴起使我们能够轻松收集普通公民的数据。然而,社交网络数据集中标签和特征的不完整性十分棘手,更不用说庞大的数据量和异构性。这些数据与许多常用数据集差异巨大,从而带来了独特的挑战。在我们的工作中,首先从Twitter构建了自己的数据集。接着,我们提出了TIMME,一种多任务多关系嵌入模型,能在稀疏标记的异构真实世界数据集上高效工作。它还能处理输入特征的不完整性。实验结果表明,在Twitter上的意识形态检测任务中,TIMME总体上优于SOTA模型。我们的发现包括:在没有文本的情况下,链接也能带来良好的分类结果;保守派声音在Twitter上代表性不足;关注是预测意识形态最重要的关系;转发和提及增加了点赞的可能性等。最后,理论上TIMME可以扩展到其他数据集和任务。

关键词

引用

@article{arxiv.2006.01321,
  title  = {TIMME: Twitter Ideology-detection via Multi-task Multi-relational Embedding},
  author = {Zhiping Xiao and Weiping Song and Haoyan Xu and Zhicheng Ren and Yizhou Sun},
  journal= {arXiv preprint arXiv:2006.01321},
  year   = {2020}
}

备注

In proceedings of KDD'20, Applied Data Science Track; 9 pages, 2 supplementary pages