KATE:用于文本的 K-竞争自编码器
机器学习
2017-06-06 v2 机器学习
摘要
自编码器在从图像数据集中学习有意义的表示方面已取得的成功。然而,其在文本数据集上的性能尚未得到广泛研究。传统的自编码器倾向于学习文本文档的可能琐碎的表示,这是由于其具有高维性、稀疏性和幂律词分布等混淆特性。在本文中,我们提出了一种用于文本文档的新型 k-竞争自编码器,称为 KATE。由于隐藏层中神经元之间的竞争,每个神经元都专门于识别特定的数据模式,总体而言,该模型能够学习文本数据的有意义表示。一套全面的实验表明,KATE 能够比包括去噪、收缩、变分和 k-稀疏自编码器在内的传统自编码器学习到更好的表示。我们的模型在文档分类、回归和检索等多项下游任务中,也优于深度生成模型、概率主题模型甚至词表示模型(如 Word2Vec)。
引用
@article{arxiv.1705.02033,
title = {KATE: K-Competitive Autoencoder for Text},
author = {Yu Chen and Mohammed J. Zaki},
journal= {arXiv preprint arXiv:1705.02033},
year = {2017}
}
备注
10 pages, KDD'17