中文

基于 Transformer 的卡纳达语-英语混合文本词级语言识别模型

计算与语言 2022-11-29 v1 人工智能

摘要

在自然语言处理(NLP)研究中使用码混合数据目前受到大量关注。由于社交媒体在交流中的进步和影响,社交媒体码混合文本的语言识别近年来一直是一个有趣的研究问题。本文介绍了墨西哥国立理工学院计算研究中心(CIC)团队在 ICON2022 的 CoLI-Kanglish 共享任务上的系统描述论文。在本文中,我们提出使用基于 Transformer 的模型用于码混合卡纳达语-英语文本中的词级语言识别。所提出的模型在 CoLI-Kenglish 数据集上取得了 0.84 的加权 F1 分数与 0.61 的宏 F1 分数。

关键词

引用

@article{arxiv.2211.14459,
  title  = {Transformer-based Model for Word Level Language Identification in Code-mixed Kannada-English Texts},
  author = {Atnafu Lambebo Tonja and Mesay Gemeda Yigezu and Olga Kolesnikova and Moein Shahiki Tash and Grigori Sidorov and Alexander Gelbuk},
  journal= {arXiv preprint arXiv:2211.14459},
  year   = {2022}
}