基于预训练多语言句子表示的零样本依存句法分析
计算与语言
2019-10-15 v1
摘要
我们研究在大规模多语言语料库上训练的现成深度双向句子表示(多语言 BERT)是否能够支持开发无监督通用依存句法分析器。该方法仅利用多种语言的单语语料库混合,且不需要任何翻译数据,因此可应用于低资源语言。在我们的实验中,在使用单一系统的情况下,我们在 CoNLL 2018 共享任务的全部六种真正低资源语言上均优于最佳语言特定系统。然而,我们也发现:(i)改变训练语言时解析准确率仍剧烈变化;(ii)在某些目标语言中,在所有测试条件下零样本迁移均失败,这对整个方法的“通用性”提出了担忧。
引用
@article{arxiv.1910.05479,
title = {Zero-shot Dependency Parsing with Pre-trained Multilingual Sentence Representations},
author = {Ke Tran and Arianna Bisazza},
journal= {arXiv preprint arXiv:1910.05479},
year = {2019}
}
备注
DeepLo workshop, EMNLP 2019