基于多语言BERT的零样本跨语言迁移中的特征聚合
计算与语言
2022-05-18 v1
摘要
多语言BERT(mBERT)是一种在大规模多语言语料库上预训练的语言模型,具有令人印象深刻的零样本跨语言迁移能力,在零样本词性标注(POS tagging)和命名实体识别(NER)以及跨语言模型迁移上表现惊人。目前,解决跨语言下游任务的主流方法总是使用mBERT的最后一个Transformer层的输出作为语言信息的表示。在这项工作中,我们探索了mBERT较低层对最后一层Transformer层的互补特性。我们提出了一种基于注意力机制的特征聚合模块,用于融合mBERT不同层中包含的信息。实验在四个零样本跨语言迁移数据集上进行,所提出的方法在关键多语言基准任务XNLI(+1.5%)、PAWS-X(+2.4%)、NER(+1.2 F1)和POS(+1.5 F1)上均获得了性能提升。通过对实验结果的分析,我们证明了mBERT最后一层之前的层可以为跨语言下游任务提供额外有用的信息,并从经验上探索了mBERT的可解释性。
引用
@article{arxiv.2205.08497,
title = {Feature Aggregation in Zero-Shot Cross-Lingual Transfer Using Multilingual BERT},
author = {Beiduo Chen and Wu Guo and Quan Liu and Kun Tao},
journal= {arXiv preprint arXiv:2205.08497},
year = {2022}
}
备注
Accepted by ICPR 2022