中文

转写体印地语与马拉雅拉姆语的跨语言文本分类

计算与语言 2021-09-01 v1 机器学习

摘要

在社交媒体上转写(transliteration)非常普遍,但现代神经模型在各种 NLP 任务中并不能充分处理转写文本。在这项工作中,我们结合数据增强方法与教师-学生训练方案,在跨语言迁移设定下针对最先进的多语言预训练语言模型(如 mBERT 和 XLM-R)微调来解决此问题。我们在转写印地语和马拉雅拉姆语上评估了我们的方法,并引入了用于真实场景基准测试的新数据集:一个是转写马拉雅拉姆语的情感分类数据集,另一个是转写印地语和马拉雅拉姆语的危机推文分类数据集(与 2013 年北印度和 2018 年喀拉拉洪水相关)。我们的方法在 F1 分数上相比其强基线在 mBERT 上平均提升 +5.6%,在 XLM-R 上平均提升 +4.7%。

关键词

引用

@article{arxiv.2108.13620,
  title  = {Cross-Lingual Text Classification of Transliterated Hindi and Malayalam},
  author = {Jitin Krishnan and Antonios Anastasopoulos and Hemant Purohit and Huzefa Rangwala},
  journal= {arXiv preprint arXiv:2108.13620},
  year   = {2021}
}

备注

12 pages, 5 tables, 7 Figures