AraDIC:基于图像化字符嵌入与类平衡损失的阿拉伯语文档分类
计算与语言
2020-06-23 v1
摘要
用于阿拉伯语文本分类的经典方法及部分深度学习技术通常依赖于复杂的形态分析、分词和人工设计的特征工程。这些可通过使用字符级特征来消除。我们受基于图像的字符嵌入工作启发,提出一种新颖的端到端阿拉伯语文档分类框架——阿拉伯语文档图像分类器(AraDIC)。AraDIC由基于图像的字符编码器与分类器组成,采用类平衡损失以端到端方式训练,从而应对长尾数据分布问题。为评估AraDIC的有效性,我们创建并发布了两个数据集:阿拉伯语维基百科标题(AWT)数据集与阿拉伯语诗歌(AraP)数据集。据我们所知,这是首个解决阿拉伯语文本分类问题的基于图像的字符嵌入框架。我们还提出了首个基于深度学习的文本分类器,在现代标准阿拉伯语、口语阿拉伯语和古典阿拉伯语上进行了广泛评估。AraDIC在微平均和宏平均F值上分别比经典与深度学习基线提升12.29%和23.05%。
引用
@article{arxiv.2006.11586,
title = {AraDIC: Arabic Document Classification using Image-Based Character Embeddings and Class-Balanced Loss},
author = {Mahmoud Daif and Shunsuke Kitada and Hitoshi Iyatomi},
journal= {arXiv preprint arXiv:2006.11586},
year = {2020}
}