中文

一种基于文本语义的智能CNN-VAE文本表示技术用于全面大数据

机器学习 2020-08-31 v1 机器学习

摘要

在大数据时代,互联网产生的大量文本数据催生了多种文本表示方法。在自然语言处理(NLP)中,文本表示将文本转换为计算机可处理的向量,同时不丢失原始语义信息。然而,这些方法难以有效提取词间的语义特征并区分语言中的多义词。因此,提出了一种基于卷积神经网络(CNN)和变分自编码器(VAE)的文本特征表示模型,用于提取文本特征,并将获得的文本特征表示应用于文本分类任务。CNN用于提取文本向量的特征以获取词间语义,VAE用于使文本特征空间更符合高斯分布。此外,改进的word2vec模型的输出被用作所提模型的输入,以区分同一词在不同上下文中的不同含义。实验结果表明,所提模型在k近邻(KNN)、随机森林(RF)和支持向量机(SVM)分类算法中表现更优。

关键词

引用

@article{arxiv.2008.12522,
  title  = {An Intelligent CNN-VAE Text Representation Technology Based on Text Semantics for Comprehensive Big Data},
  author = {Genggeng Liu and Canyang Guo and Lin Xie and Wenxi Liu and Naixue Xiong and Guolong Chen},
  journal= {arXiv preprint arXiv:2008.12522},
  year   = {2020}
}