中文

基于深度神经网络的乌尔都语新闻层次化文本分类

计算与语言 2021-07-08 v1

摘要

互联网上的数字文本日益增长。对大规模且异构的数据集合进行分类极具挑战性,需要改进的信息处理方法来组织文本。为分类大规模语料,一种常用方法是使用层次化文本分类,旨在以层次结构对文本数据进行分类。已有若干方法被提出以应对文本分类,但大多数研究基于英语语言。本文提出一种用于乌尔都语新闻层次化文本分类的深度学习模型——包含来自 8 个在线新闻网站的 51,325 个句子,所属体裁为:体育、科技和娱乐。本文的目标有二:(1)构建一个用于层次化文本分类的大规模人工标注乌尔都语新闻数据集;(2)使用我们提出的基于 LSTM 机制的名为层次化多层 LSTM(HMLSTM)的模型对乌尔都语新闻进行层次化分类。我们的模型由两个模块组成:文本表示层,用于获取文本表示,其中我们使用 Word2vec 嵌入将词转化为向量;以及乌尔都语层次化 LSTM 层(UHLSTML),一个端到端全连接深度 LSTM 网络以执行自动特征学习,我们为类层次的每个级别训练一个 LSTM 层。我们在自建的名为乌尔都语层次化文本分类新闻数据集(UNDHTC)上进行了大量实验。结果表明,我们提出的方法对层次化文本分类非常有效,显著优于基线方法,并且相较于深度神经模型也取得了良好结果。

关键词

引用

@article{arxiv.2107.03141,
  title  = {Hierarchical Text Classification of Urdu News using Deep Neural Network},
  author = {Taimoor Ahmed Javed and Waseem Shahzad and Umair Arshad},
  journal= {arXiv preprint arXiv:2107.03141},
  year   = {2021}
}

备注

22 pages with 16 figures