将词嵌入整合入基于开放目录项目的大规模分类
计算与语言
2018-04-04 v1
摘要
近来,隐式表示模型(如嵌入或深度学习)因其卓越性能已成功应用于文本分类任务。然而,这些方法局限于小规模或中等规模文本分类。显式表示模型常用于大规模文本分类,如基于开放目录项目(ODP)的文本分类。但这些模型的性能受限于关联的知识库。本文中,我们将词嵌入整合入基于 ODP 的大规模分类。为此,我们首先生成类别向量,其通过联合建模词嵌入和基于 ODP 的文本分类来表示 ODP 类别的语义。然后我们提出一种新颖的语义相似度度量,其利用从联合模型获得的类别向量和从词嵌入获得的词向量。评估结果清晰显示了我们的方法在大规模文本分类中的有效性。所提方案在宏平均 F1 分数和前 k 精度上分别比最先进技术显著提高了 10% 和 28%。
引用
@article{arxiv.1804.00828,
title = {Incorporating Word Embeddings into Open Directory Project based Large-scale Classification},
author = {Kang-Min Kim and Aliyeva Dinara and Byung-Ju Choi and SangKeun Lee},
journal= {arXiv preprint arXiv:1804.00828},
year = {2018}
}
备注
12 pages, 2 figures, In proceedings of the 22nd Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD)