中文

推文语义表示的解析

计算与语言 2017-06-22 v2

摘要

随着大量研究将表示学习模型应用于情感分析、语义文本相似度计算、话题标签预测等任务,微博平台分析研究正经历新一轮的激增。尽管在此类任务中,表示学习模型的性能已优于传统基线,但关于推文在这些表示中编码的基本性质,或为何特定表示在某些任务中表现更佳,目前知之甚少。我们在此展示的工作是揭开推文向量嵌入黑箱的第一步。面向高层应用的传统特征工程方法利用了推文的各种基本性质。我们认为,推文表示之所以对某一应用有效,是因为它精细地编码了该应用特定的推文基本性质。为了理解推文表示中编码的基本性质,我们评估了这些表示在建模各项性质时的准确度,这些性质包括推文长度、特定词的存在、话题标签、提及、大写等。我们对九种有监督和四种无监督推文表示进行了系统且广泛的研究,考察了它们与最流行的八种文本基本性质和五种社交基本性质的对应关系,结果表明双向 LSTM (BLSTM) 和 Skip-Thought Vectors (STV) 分别最好地编码了推文的文本和社交性质。FastText 是低资源环境下的最佳模型,在嵌入维度减小时性能下降极小。最后,我们通过将基本性质预测任务中获得的模型性能与高层下游应用相关联,得出了有趣的见解。

关键词

引用

@article{arxiv.1704.00898,
  title  = {Interpretation of Semantic Tweet Representations},
  author = {J Ganesh and Manish Gupta and Vasudeva Varma},
  journal= {arXiv preprint arXiv:1704.00898},
  year   = {2017}
}

备注

Accepted at ASONAM 2017; Initial version presented at NIPS 2016 workshop can be found at arXiv:1611.04887