中文

面向突尼斯Arabizi多级标注的多任务序列预测

计算与语言 2021-01-08 v3

摘要

本文提出一种基于循环神经网络的多任务序列预测系统,用于对突尼斯Arabizi语料库进行多级标注。所执行的标注包括文本分类、分词、词性标注以及将突尼斯Arabizi编码为CODA*阿拉伯文正字法。该系统被学习为从Arabizi输入开始级联预测所有标注层级。我们在TIGER德语语料库上评估该系统,将数据作适当转换以构成多任务问题,从而展示我们神经架构的有效性。我们也展示了如何将该系统用于标注突尼斯Arabizi语料库,该语料库后经人工校正并用于进一步评估突尼斯数据上的序列模型。我们的系统为Fairseq框架开发,可快速便捷地用于任何其他序列预测问题。

关键词

引用

@article{arxiv.2011.05152,
  title  = {Multi-Task Sequence Prediction For Tunisian Arabizi Multi-Level Annotation},
  author = {Elisa Gugliotta and Marco Dinarelli and Olivier Kraif},
  journal= {arXiv preprint arXiv:2011.05152},
  year   = {2021}
}

备注

Paper accepted at the Fifth Arabic Natural Language Processing Workshop (WANLP) 2020