中文

PhoNLP:用于越南语词性标注、命名实体识别与依存句法分析的联合多任务学习模型

计算与语言 2021-04-09 v2

摘要

我们提出了首个多任务学习模型——名为PhoNLP——用于联合越南语词性标注(POS)、命名实体识别(NER)与依存句法分析。在越南语基准数据集上的实验表明,PhoNLP取得了最先进的结果,优于为每项任务独立微调预训练越南语语言模型PhoBERT(Nguyen and Nguyen, 2020)的单任务学习方法。我们以Apache License 2.0开源协议公开发布PhoNLP作为开源工具包。尽管我们针对越南语指定了PhoNLP,但我们的PhoNLP训练与评估命令脚本实际上可直接用于其他拥有预训练BERT类语言模型以及针对词性标注、命名实体识别和依存句法分析三项任务的黄金标注语料库的语言。我们希望PhoNLP能够作为强大的基线与有用的工具包,服务于未来不仅针对越南语而且针对其他语言的NLP研究与应用。我们的PhoNLP可在以下地址获取:https://github.com/VinAIResearch/PhoNLP

关键词

引用

@article{arxiv.2101.01476,
  title  = {PhoNLP: A joint multi-task learning model for Vietnamese part-of-speech tagging, named entity recognition and dependency parsing},
  author = {Linh The Nguyen and Dat Quoc Nguyen},
  journal= {arXiv preprint arXiv:2101.01476},
  year   = {2021}
}

备注

To appear in Proceedings of NAACL 2021: Demonstrations