中文

零资源设定下跨语言序列标注的模型与数据迁移

计算与语言 2023-04-28 v2

摘要

零资源跨语言迁移方法旨在将源语言上的有监督模型应用于无标注目标语言。本文对迄今用于跨语言零资源序列标注的两种主要技术(基于数据或基于模型迁移)进行了深入研究。尽管已有研究提出翻译与标注投影(基于数据的跨语言迁移)作为跨语言序列标注的有效技术,本文通过实验证明,在零样本(基于模型的跨语言迁移)设定下应用高容量多语言语言模型始终优于基于数据的跨语言迁移方法。对我们结果的详细分析表明,这可能是由于语言使用上的重要差异。更具体地,机器翻译常生成与模型在金标准数据下所接触信号不同的文本信号,这影响了微调与评估过程。我们的结果还表明,当高容量多语言语言模型不可用时,基于数据的跨语言迁移方法仍是一种具有竞争力的选择。

关键词

引用

@article{arxiv.2210.12623,
  title  = {Model and Data Transfer for Cross-Lingual Sequence Labelling in Zero-Resource Settings},
  author = {Iker García-Ferrero and Rodrigo Agerri and German Rigau},
  journal= {arXiv preprint arXiv:2210.12623},
  year   = {2023}
}

备注

Findings of the Association for Computational Linguistics: EMNLP 2022