万事俱备:零样本跨语言信息抽取的多管齐下策略
计算与语言
2021-09-15 v1
摘要
零样本跨语言信息抽取(IE)指的是在仅有其他语言(通常为英语)已有标注的情况下,为某目标语言构建 IE 模型。尽管预训练多语言编码器的发展令人轻易乐观地认为“在英语上训练,在任何语言上运行”,我们通过深入探索与扩展各类技术发现,新旧方法的组合比任一特定的跨语言策略性能更优。我们探索了包括数据投影与自训练在内的技术,以及不同预训练编码器对它们的影响。我们以英语到阿拉伯语 IE 作为初始示例,展示了在事件抽取、命名实体识别、词性标注与依存句法分析中该设定下的强劲性能。随后我们将数据投影与自训练应用于跨八种目标语言的三项任务。由于没有单一技术集在所有任务上均表现最佳,我们鼓励实践者在寻求改进零样本训练时探索本工作中所述技术的多种配置。
引用
@article{arxiv.2109.06798,
title = {Everything Is All It Takes: A Multipronged Strategy for Zero-Shot Cross-Lingual Information Extraction},
author = {Mahsa Yarmohammadi and Shijie Wu and Marc Marone and Haoran Xu and Seth Ebner and Guanghui Qin and Yunmo Chen and Jialiang Guo and Craig Harman and Kenton Murray and Aaron Steven White and Mark Dredze and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2109.06798},
year = {2021}
}
备注
EMNLP 2021