基于多语言蒸馏与零样本感知训练的跨语言文本分类
计算与语言
2022-03-01 v1
摘要
多语言预训练语言模型(MPLMs)不仅能处理不同语言的任务,还展现出令人惊讶的零样本跨语言迁移能力。然而,与最先进的单语预训练模型相比,MPLMs 通常无法在富资源语言上取得可比的有监督性能。本文旨在仅利用有监督语言资源,同时提升多语言模型的有监督性能与零样本性能。我们的方法基于以师生框架从高性能单语模型迁移知识。我们让多语言模型同时从多个单语模型学习。为利用模型的跨语言迁移能力,我们提出 MBLM(多分支多语言语言模型),一种构建于 MPLMs 之上、具有多个语言分支的模型。每个分支是一堆叠的 transformers。MBLM 采用零样本感知训练策略进行训练,该策略鼓励模型从所有分支的零样本表示混合中学习。在两个跨语言分类任务上的结果表明,仅使用任务的有监督数据,我们的方法提升了 MPLMs 的有监督与零样本性能。
关键词
引用
@article{arxiv.2202.13654,
title = {Cross-Lingual Text Classification with Multilingual Distillation and Zero-Shot-Aware Training},
author = {Ziqing Yang and Yiming Cui and Zhigang Chen and Shijin Wang},
journal= {arXiv preprint arXiv:2202.13654},
year = {2022}
}
备注
7 pages