L3Cube-HingCorpus 与 HingBERT:一种码混印地语-英语数据集及 BERT 语言模型
计算与语言
2022-04-19 v1 机器学习
摘要
当在一个句子或对话中混合使用超过一种语言时,就会发生语码转换(code-switching)。这种现象在社交媒体平台上更为突出,并且其采用程度随时间不断增加。因此,码混自然语言处理已在文献中被广泛研究。随着基于预训练 Transformer 的架构日益流行,我们观察到真实的码混数据稀缺,不足以预训练大型语言模型。我们提出 L3Cube-HingCorpus,这是首个大规模真实罗马字书写的印地语-英语码混数据,包含从 Twitter 抓取的 5293 万句子和 10.4 亿词元。我们进一步提出 HingBERT、HingMBERT、HingRoBERTa 和 HingGPT。这些 BERT 模型使用掩码语言建模目标在码混的 HingCorpus 上进行了预训练。我们展示了这些 BERT 模型在 GLUECoS 基准上后续下游任务(如码混情感分析、词性标注、命名实体识别和语言识别)中的有效性。HingGPT 是一个基于 GPT2 的生成式 Transformer 模型,能够生成完整的推文。我们还发布了 L3Cube-HingLID Corpus,这是最大的码混印地语-英语语言识别(LID)数据集,以及 HingBERT-LID,一个生产质量的 LID 模型,以借助本文概述的流程促进更多码混数据的采集。数据集与模型见 https://github.com/l3cube-pune/code-mixed-nlp。
引用
@article{arxiv.2204.08398,
title = {L3Cube-HingCorpus and HingBERT: A Code Mixed Hindi-English Dataset and BERT Language Models},
author = {Ravindra Nayak and Raviraj Joshi},
journal= {arXiv preprint arXiv:2204.08398},
year = {2022}
}