通过基本属性预测任务解读推文表示中的句法与社会元素
计算与语言
2016-11-16 v1 社会与信息网络
摘要
社交媒体分析研究近期蓬勃发展,大量工作应用表示学习模型来解决高层次句法-语义任务,如情感分析、语义文本相似度计算、话题标签预测等。尽管表示学习模型在这些任务上的表现优于传统基线,但人们对推文表示中所编码的核心属性知之甚少。理解这些核心属性将使我们能够对表示的质量得出可推广的结论。本文所呈现的工作构成了打开社交媒体帖子(尤其是推文)向量嵌入黑箱的第一步。为了理解推文表示中编码的核心属性,我们评估这些表示,以估计其对推文长度、词语存在、话题标签、提及、大写等每个属性的建模程度。这借助多个以表示为输入的分类器来完成。本质上,每个分类器评估一个对推文而言可能显著的句法或社会属性。这也是首次全面研究,广泛分析了多种推文表示模型编码这些属性的能力,包括传统的无监督方法(BOW, LDA)、无监督表示学习方法(Siamese CBOW, Tweet2Vec)以及有监督方法(CNN, BLSTM)。
引用
@article{arxiv.1611.04887,
title = {Interpreting the Syntactic and Social Elements of the Tweet Representations via Elementary Property Prediction Tasks},
author = {J Ganesh and Manish Gupta and Vasudeva Varma},
journal= {arXiv preprint arXiv:1611.04887},
year = {2016}
}
备注
Presented at NIPS 2016 Workshop on Interpretable Machine Learning in Complex Systems