双语语言建模:一种面向罗马乌尔都语的迁移学习技术
计算与语言
2021-02-23 v1
摘要
预训练语言模型现已在自然语言处理中广泛使用。尽管它们取得了成功,将其应用于低资源语言仍是一项巨大挑战。虽然多语言模型大有前景,但将其应用于特定的低资源语言(例如罗马乌尔都语)可能过于繁重。在本文中,我们展示了如何利用语言的语码转换特性来从高资源对应语言进行跨语言迁移学习。我们还展示了这种称为双语语言建模的迁移学习技术如何用于为罗马乌尔都语生成性能更好的模型。为支持训练和实验,我们还呈现了从各种来源和社交网站(例如 Twitter)提取的罗马乌尔都语新型语料库集合。我们训练了罗马乌尔都语的单语、多语和双语模型——所提出的双语模型在掩码语言建模(MLM)任务中取得了 23% 的准确率,而单语和多语模型分别为 2% 和 11%。
引用
@article{arxiv.2102.10958,
title = {Bilingual Language Modeling, A transfer learning technique for Roman Urdu},
author = {Usama Khalid and Mirza Omer Beg and Muhammad Umair Arshad},
journal= {arXiv preprint arXiv:2102.10958},
year = {2021}
}