中文

基于深度生成模型在新综合数据集上的孟加拉语文本分类特征提取

信息检索 2023-08-29 v1 计算与语言 机器学习

摘要

文本分类的特征选择是文本挖掘与信息检索中的基础任务。尽管孟加拉语是全球第六大通用语言,但由于文本数据集匮乏,其受到的关注甚少。本研究收集、标注并整理了一个包含212,184篇孟加拉语文档、涵盖七类的新综合数据集,并公开提供。我们实现了三种深度学习生成模型:LSTM变分自编码器(LSTM VAE)、辅助分类器生成对抗网络(AC-GAN)与对抗自编码器(AAE)来提取文本特征,尽管它们最初应用于计算机视觉领域。我们利用该数据集训练这三种模型,并将所得特征空间用于文档分类任务。我们评估了分类器性能,发现对抗自编码器模型产生了最佳特征空间。

关键词

引用

@article{arxiv.2308.13545,
  title  = {Feature Extraction Using Deep Generative Models for Bangla Text Classification on a New Comprehensive Dataset},
  author = {Md. Rafi-Ur-Rashid and Sami Azam and Mirjam Jonkman},
  journal= {arXiv preprint arXiv:2308.13545},
  year   = {2023}
}

备注

To be submitted in Heliyon Journal