中文

基于码混合 BERT 的印地语-英语推文语言识别

计算与语言 2021-07-05 v1 机器学习

摘要

近年来,社交媒体文本的语言识别一直是一个引人关注的研究问题。在非英语地区,社交媒体消息 predominantly 为码混合形式。通过预训练上下文嵌入获得的先验知识,已在一系列下游任务中取得最先进结果。近来,BERT 等模型表明,利用大量无标注数据,预训练语言模型对学习通用语言表示更为有益。本文呈现了利用迁移学习与微调 BERT 模型以识别 Twitter 上语言的广泛实验。该工作利用 Hindi-English-Urdu 码混合文本进行语言预训练,并利用 Hindi-English 码混合文本进行后续的词级语言分类。结果表明,在码混合数据上预训练的表示优于其单语对应表示。

关键词

引用

@article{arxiv.2107.01202,
  title  = {Language Identification of Hindi-English tweets using code-mixed BERT},
  author = {Mohd Zeeshan Ansari and M M Sufyan Beg and Tanvir Ahmad and Mohd Jazib Khan and Ghazali Wasim},
  journal= {arXiv preprint arXiv:2107.01202},
  year   = {2021}
}