一种用于双语短信分类的多级联深度模型
计算与语言
2019-12-16 v1
摘要
大多数文本分类研究集中于英语。然而,诸如短信等短文本会受到区域语言的影响。这使得由于文本中语言的多语、非正式和噪声特性,自动文本分类任务具有挑战性。在这项工作中,我们提出了一种称为 McM 的新型多级联深度学习模型,用于双语短信分类。McM 利用 -gram 级别信息以及文本的长期依赖关系进行学习。我们的方法旨在学习一个模型,而无需任何语码转换指示、词汇归一化、语言翻译或语言音译。该模型完全依赖于文本,因为学习过程中未使用任何外部知识库。为此,我们从市民关于公共服务的短信反馈中构建了一个包含罗马乌尔都语与英语混合的 12 类双语文本数据集。我们的模型在该数据集上实现了高分类准确率,并优于先前多语文本分类模型,凸显了 McM 的语言无关性。
引用
@article{arxiv.1911.13066,
title = {A Multi-cascaded Deep Model for Bilingual SMS Classification},
author = {Muhammad Haroon Shakeel and Asim Karim and Imdadullah Khan},
journal= {arXiv preprint arXiv:1911.13066},
year = {2019}
}