面向希伯来语自然语言处理的多语言序列到序列模型
计算与语言
2022-12-20 v1
摘要
近期研究将自然语言处理的进展归因于模型规模增大和预训练数据量庞大的大型语言模型。尽管如此,当前最先进的希伯来语语言模型与其他语言的模型相比,既参数不足又训练不足。此外,先前关于预训练希伯来语语言模型的工作主要集中在仅编码器模型上。虽然仅编码器架构对分类任务有益,但在考虑希伯来语形态丰富的特性时,它并不能很好地满足诸如命名实体识别之类的子词预测任务。在本文中,我们认为对于像希伯来语这样的形态丰富语言,序列到序列的生成式架构更适合大型语言模型。我们证明,通过将希伯来语自然语言处理流程中的任务转化为文本到文本任务,我们可以利用强大的多语言预训练序列到序列模型(如mT5),从而无需专门的、基于语素的、单独微调的解码器。使用这种方法,我们的实验显示,在现有希伯来语自然语言处理基准上,结果显著优于先前发表的结果。这些结果表明,多语言序列到序列模型为形态丰富语言的自然语言处理提供了一个有前景的构建模块。
引用
@article{arxiv.2212.09682,
title = {Multilingual Sequence-to-Sequence Models for Hebrew NLP},
author = {Matan Eyal and Hila Noga and Roee Aharoni and Idan Szpektor and Reut Tsarfaty},
journal= {arXiv preprint arXiv:2212.09682},
year = {2022}
}