基于词向量表示与降维的文本比较
计算与语言
2016-07-05 v1
摘要
本文描述了一种利用词向量表示(word2vec)和降维技术(t-SNE)比较大型文本源的方法,并说明了如何使用 Python 实现。该方法提供了文本源(例如文本摘要及其源材料)的鸟瞰视图,使用户能够像浏览地理地图一样探索文本源。词向量表示捕捉了许多语言属性,如性别、时态、复数,甚至像“首都”这样的语义概念。通过降维,可以计算出一幅二维地图,其中语义相似的词彼此靠近。该方法使用了 gensim Python 库中的 word2vec 模型和 scikit-learn 中的 t-SNE。
引用
@article{arxiv.1607.00534,
title = {Text comparison using word vector representations and dimensionality reduction},
author = {Hendrik Heuer},
journal= {arXiv preprint arXiv:1607.00534},
year = {2016}
}