Tweet2Vec:面向社交媒体的基于字符的分布式表示
机器学习
2016-05-18 v2 计算与语言
摘要
社交媒体文本带来了一系列挑战,可能导致传统的自然语言处理方法失败。非正式语言、拼写错误、缩写和特殊字符在这些帖子中司空见惯,导致基于词级别的方法面临词汇量过大的问题。我们提出了一个字符组合模型 tweet2vec,它通过学习字符序列中复杂的、非局部的依赖关系来寻找整个推文的向量空间表示。所提出的模型在预测与帖子关联的用户标注话题标签方面优于词级别基线模型,当输入包含许多词汇表外单词或不寻常的字符序列时,其表现显著更好。我们的 tweet2vec 编码器已公开发布。
引用
@article{arxiv.1605.03481,
title = {Tweet2Vec: Character-Based Distributed Representations for Social Media},
author = {Bhuwan Dhingra and Zhong Zhou and Dylan Fitzpatrick and Michael Muehl and William W. Cohen},
journal= {arXiv preprint arXiv:1605.03481},
year = {2016}
}
备注
6 pages, 2 figures, 4 tables, accepted as conference paper at ACL 2016