中文

通过翻译对预测改进社交媒体文本的多语言语言模型预训练

计算与语言 2021-10-22 v1 机器学习

摘要

我们评估了一种简单方法,通过增加一个称为翻译对预测(TPP)的预训练任务来改进 mBERT 在社交媒体语料上的零样本多语言迁移,该任务预测一对跨语言文本是否为有效翻译。我们的方法假设可获取源语言-目标语言对之间的翻译(精确或近似),并在源语言任务数据上微调模型,在目标语言中评估模型。我们特别关注 mBERT 难以进行迁移学习的语言对:那些源语言与目标语言在文字系统、词汇和语言类型学上均不同的语言对。我们展示了在两项社交媒体任务上,TPP 预训练相较单独的 mBERT 从英语到印地语、阿拉伯语和日语的零样本迁移有所提升:NER(目标语言间 F1 平均相对提升 37%)和社交媒体文本情感分类(F1 相对提升 12%),同时还在非社交媒体任务 Universal Dependency POS 标注上进行了基准测试(准确率相对提升 6.7%)。鉴于缺乏社交媒体双语语料,我们的结果令人鼓舞。我们的代码见:https://github.com/twitter-research/multilingual-alignment-tpp。

关键词

引用

@article{arxiv.2110.10318,
  title  = {Improved Multilingual Language Model Pretraining for Social Media Text via Translation Pair Prediction},
  author = {Shubhanshu Mishra and Aria Haghighi},
  journal= {arXiv preprint arXiv:2110.10318},
  year   = {2021}
}

备注

Camera ready version. Accepted to WNUT 2021. Code for reproducing the experiments can be found at: https://github.com/twitter-research/multilingual-alignment-tpp