中文

用于跨语言标签投影的约束解码

计算与语言 2024-02-06 v1 机器学习

摘要

利用多语言大语言模型 (LLM) 进行零样本跨语言迁移已成为没有标注训练数据的低资源语言的一种流行学习范式。然而,对于涉及词和短语细粒度预测的自然语言处理 (NLP) 任务,零样本跨语言迁移学习的性能远远落后于监督微调方法。因此,通常利用翻译和标签投影来进一步提高性能,方法包括:(1) 将高资源语言(如英语)中可用的训练数据及其金标准标签翻译到低资源语言;和/或 (2) 将低资源语言的测试数据翻译到高资源语言以进行推理,然后将预测的跨度级标签投影回原始测试数据。然而,最先进的基于标记的标签投影方法由于在输入到翻译模型的文本中注入了额外的标签标记,导致翻译质量下降。在这项工作中,我们探索了一个利用约束解码进行标签投影的新方向,以克服上述问题。我们的新方法不仅可以保持翻译文本的质量,而且具有适用于翻译训练数据和翻译测试数据两种策略的通用性。这种通用性至关重要,因为我们的实验表明,与仅翻译训练数据相比,翻译测试数据可以带来显著的性能提升。我们在命名实体识别和事件论元提取这两个跨语言迁移任务上进行了评估,涵盖 20 种语言。结果表明,我们的方法大幅优于最先进的基于标记的方法,并且在性能上也优于其他依赖外部词对齐的标签投影方法。

关键词

引用

@article{arxiv.2402.03131,
  title  = {Constrained Decoding for Cross-lingual Label Projection},
  author = {Duong Minh Le and Yang Chen and Alan Ritter and Wei Xu},
  journal= {arXiv preprint arXiv:2402.03131},
  year   = {2024}
}

备注

Accepted at ICLR 2024