Tweet2Vec:使用字符级CNN-LSTM编码器-解码器学习推文嵌入
计算与语言
2016-07-27 v1 人工智能
神经与进化计算
社会与信息网络
摘要
我们提出Tweet2Vec,一种生成推文通用向量表示的新方法。该模型使用字符级CNN-LSTM编码器-解码器学习推文嵌入。我们在300万条随机选取的英文推文上训练了模型。通过推文语义相似度和推文情感分类两种方法对模型进行了评估,在这两项任务上均超越了此前的最优水平。评估结果证明了我们模型生成的推文嵌入在各种推文分类任务中的强大能力。我们模型生成的向量表示是通用的,因此可应用于多种任务。尽管本文提出的模型是在英文推文上训练的,但所提出的方法可用于学习不同语言的推文嵌入。
引用
@article{arxiv.1607.07514,
title = {Tweet2Vec: Learning Tweet Embeddings Using Character-level CNN-LSTM Encoder-Decoder},
author = {Soroush Vosoughi and Prashanth Vijayaraghavan and Deb Roy},
journal= {arXiv preprint arXiv:1607.07514},
year = {2016}
}
备注
SIGIR 2016, July 17-21, 2016, Pisa. Proceedings of SIGIR 2016. Pisa, Italy (2016)