基于上下文嵌入的对抗学习用于零资源跨语言分类与命名实体识别
计算与语言
2020-03-23 v3 机器学习
摘要
上下文词嵌入(如 GPT、BERT、ELMo 等)已在各种 NLP 任务上展示了最先进的性能。近期关于多语言版 BERT 的研究表明,该模型在零样本和零资源跨语言设定下表现非常好,其中仅使用带标注的英文数据来微调模型。我们通过对抗学习改进了多语言 BERT 的零资源跨语言性能。我们报告了在多语言 MLDoc 文本分类和 CoNLL 2002/2003 命名实体识别任务上改进的幅度。此外,我们展示了语言对抗训练促使 BERT 对齐英文文档及其翻译的嵌入,这可能是观测到的性能提升的原因。
引用
@article{arxiv.1909.00153,
title = {Adversarial Learning with Contextual Embeddings for Zero-resource Cross-lingual Classification and NER},
author = {Phillip Keung and Yichao Lu and Vikas Bhardwaj},
journal= {arXiv preprint arXiv:1909.00153},
year = {2020}
}
备注
In EMNLP 2019