数据集:基于推文与通用数据训练的词嵌入
计算与语言
2017-08-15 v1 社会与信息网络
摘要
词嵌入是一种低维、稠密且实值的词向量表示。词嵌入已被用于许多自然语言处理任务,通常从大型文本语料库中生成。词的嵌入能够捕捉其句法和语义两方面特征。推文简短、嘈杂,并具有独特的词汇和语义特征,与其他类型的文本不同。因此,有必要专门从推文中学习词嵌入。本文中,我们提供了十个词嵌入数据集。除了仅从推文数据中学习得到的数据集外,我们还基于通用数据以及推文与通用数据的组合构建了嵌入集。通用数据包括新闻文章、维基百科数据和其他网络数据。这十个嵌入模型是从约4亿条推文和70亿个通用文本词中学习得到的。本文还展示了两个实验,演示如何将这些数据集用于一些自然语言处理任务,例如推文情感分析和推文主题分类任务。
引用
@article{arxiv.1708.03994,
title = {Data Sets: Word Embeddings Learned from Tweets and General Data},
author = {Quanzhi Li and Sameena Shah and Xiaomo Liu and Armineh Nourbakhsh},
journal= {arXiv preprint arXiv:1708.03994},
year = {2017}
}