中文

一种用于印度语言高效文本分类的注意力集成方法

计算与语言 2021-02-23 v1 人工智能 机器学习

摘要

近期基于复杂注意力的深度学习架构的兴起,使英语各种下游 NLP 任务取得了非凡成果。然而,针对资源受限且形态丰富的印度方言语言的相关研究相对有限。本文提出了 SPPU_AKAH 团队针对 TechDOfication 2020 子任务-1f 的解决方案:该子任务聚焦于马拉地语(一种基于天城文脚本的印度语言)短文本文档的粗粒度技术领域识别。利用手头的大规模数据集,我们提出了一种混合 CNN-BiLSTM 注意力集成模型,其有效地结合了卷积神经网络与双向长短期记忆生成的中间句子表示,从而实现高效的文本分类。实验结果表明,所提模型在给定任务上优于多种基线机器学习与深度学习模型,取得了 89.57% 的最佳验证准确率与 0.8875 的 f1-score。此外,该方案成为此子任务的最佳系统提交,测试准确率达 64.26%、f1-score 为 0.6157,超越了其他团队及共享任务组织者给出的基线系统。

关键词

引用

@article{arxiv.2102.10275,
  title  = {An Attention Ensemble Approach for Efficient Text Classification of Indian Languages},
  author = {Atharva Kulkarni and Amey Hengle and Rutuja Udyawar},
  journal= {arXiv preprint arXiv:2102.10275},
  year   = {2021}
}

备注

Paper accepted and presented at the 17th International Conference on Natural Language Processing (ICON 2020) TechDoFication Shared Task