中文

My Boli:马拉地语-英语码混语料库、预训练语言模型与评估基准

计算与语言 2023-07-21 v2 机器学习

摘要

由于专用码混数据集和预训练语言模型的缺乏,码混数据的研究受到限制。在这项工作中,我们关注缺乏任何码混先前研究的低资源印度语言马拉地语。我们提出 L3Cube-MeCorpus,一个包含 1000 万条社交媒体句子的马拉地语-英语(Mr-En)大型码混语料库,用于预训练。我们还发布了 L3Cube-MeBERT 和 MeRoBERTa,即基于 BERT 的、在 MeCorpus 上预训练的码混 Transformer 模型。此外,为进行基准测试,我们提出三个有监督数据集 MeHate、MeSent 和 MeLID,分别用于码混 Mr-En 仇恨语音检测、情感分析和语言识别等下游任务。这些评估数据集各自包含人工标注的约 12,000 条马拉地语-英语码混推文。消融实验表明,在该新颖语料库上训练的模型显著优于现有的最先进 BERT 模型。这是首个提出码混马拉地语研究相关成果的工作。所有数据集和模型已在 https://github.com/l3cube-pune/MarathiNLP 公开发布。

关键词

引用

@article{arxiv.2306.14030,
  title  = {My Boli: Code-mixed Marathi-English Corpora, Pretrained Language Models and Evaluation Benchmarks},
  author = {Tanmay Chavan and Omkar Gokhale and Aditya Kane and Shantanu Patankar and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2306.14030},
  year   = {2023}
}