面向越南语的 COVID-19 命名实体识别
计算与语言
2021-04-09 v1
摘要
当前的 COVID-19 大流行促使创建了许多语料库,以促进 NLP 研究和下游应用来帮助抗击疫情。然而,这些语料库大多仅针对英语。由于大流行是全球性问题,值得为英语以外的语言创建 COVID-19 相关数据集。在本文中,我们呈现首个手动标注的越南语 COVID-19 领域专用数据集。具体而言,我们的数据集针对命名实体识别(NER)任务进行标注,并定义了可用于未来其他传染病的新型实体类型。与现有越南语 NER 数据集相比,我们的数据集还包含最多数量的实体。我们使用强基线在我们的数据集上实证开展实验,发现:越南语自动分词有助于提升 NER 结果,且通过微调预训练语言模型获得最高性能,其中越南语单语模型 PhoBERT(Nguyen and Nguyen, 2020)比多语模型 XLM-R(Conneau et al., 2020)取得更高结果。我们在 https://github.com/VinAIResearch/PhoNER_COVID19 公开发布数据集。
引用
@article{arxiv.2104.03879,
title = {COVID-19 Named Entity Recognition for Vietnamese},
author = {Thinh Hung Truong and Mai Hoang Dao and Dat Quoc Nguyen},
journal= {arXiv preprint arXiv:2104.03879},
year = {2021}
}
备注
To appear in Proceedings of NAACL 2021