中文

HIT:一种用于鲁棒码混合语言表征的分层融合深度注意力网络

计算与语言 2021-06-01 v1

摘要

理解资源匮乏的码混合文本的语言学与形态学仍是文本处理中的关键挑战。尽管词嵌入便于支撑低资源语言的下游任务,但在提升语言表征质量方面,尤其是针对码混合语言,仍有大量改进空间。本文提出HIT,一种面向码混合文本的鲁棒表征学习方法。HIT是一个基于transformer的分层框架,可捕捉词间语义关系,并通过融合注意力机制分层学习句子级语义。HIT整合了两个注意力模块——多头自注意力与外积注意力模块,并计算其加权和以获得注意力权重。我们在一种欧洲语言(西班牙语)和五种印度语言( Hindi、Bengali、Tamil、Telugu和Malayalam)上,针对十一个数据集的四个NLP任务评估HIT,结果表明其相较多种SOTA系统有显著性能提升。我们进一步展示了所学表征在迁移学习设置(含与不含微调)中跨任务的适应性。

关键词

引用

@article{arxiv.2105.14600,
  title  = {HIT: A Hierarchically Fused Deep Attention Network for Robust Code-mixed Language Representation},
  author = {Ayan Sengupta and Sourabh Kumar Bhattacharjee and Tanmoy Chakraborty and Md Shad Akhtar},
  journal= {arXiv preprint arXiv:2105.14600},
  year   = {2021}
}

备注

15 pages, 13 tables, 6 Figures. Accepted at ACL-IJCNLP-2021 (Findings)