利用多义嵌入改进文档分类
计算与语言
2019-11-20 v1 信息检索
机器学习
摘要
文本文档的高效表示是许多 NLP 任务的重要基石。关于长文本分类的研究表明,对词向量进行简单加权平均以表示句子,往往优于更复杂的神经模型。最近提出的稀疏组合文档向量(SCDV)(Mekala 等,2017)通过对词向量进行软聚类,将该方法从句子扩展到文档。然而,SCDV 忽视了词的多义性,并且也受困于高维灾难。在这项工作中,我们解决这些缺陷并提出了 SCDV-MS。SCDV-MS 利用多义词嵌入并学习一个低维流形。通过在多个真实世界数据集上的大量实验,我们表明 SCDV-MS 嵌入在多类和多标签文本分类任务上优于先前的最优嵌入。此外,在文本分类任务上,SCDV-MS 嵌入在时间和空间复杂度方面比 SCDV 更高效。
引用
@article{arxiv.1911.07918,
title = {Improving Document Classification with Multi-Sense Embeddings},
author = {Vivek Gupta and Ankit Saw and Pegah Nokhiz and Harshit Gupta and Partha Talukdar},
journal= {arXiv preprint arXiv:1911.07918},
year = {2019}
}
备注
8 Pages, 7 Figures, 12 Tables, under review at ECAI 2020