中文

CebuaNER:一个新的宿务语命名实体识别基线模型

计算与语言 2023-10-03 v1

摘要

尽管东南亚是语言多样性最丰富的地区之一,其计算语言学与语言处理研究仍难以匹敌全球北方的国家。因此,诸如开放语料库以及为基本语言处理任务开发基线模型等举措,是鼓励该领域研究增长的重要垫脚石。为响应此号召,我们推出 CebuaNER,一个用于宿务语命名实体识别(NER)的新基线模型。宿务语是菲律宾使用量第二大的母语,拥有超过两千万使用者。为构建该模型,我们收集并标注了超过 4000 篇新闻文章——为该语言任何工作中规模最大者——取自在线本地宿务语平台,用以训练条件随机场与双向 LSTM 等算法。我们的结果显示其作为新基线模型前景良好,在所有实体标签上的精确率、召回率与 F1 均超过 70%,并展现出在与他加禄语跨语言设置中的潜在效用。

关键词

引用

@article{arxiv.2310.00679,
  title  = {CebuaNER: A New Baseline Cebuano Named Entity Recognition Model},
  author = {Ma. Beatrice Emanuela Pilar and Ellyza Mari Papas and Mary Loise Buenaventura and Dane Dedoroy and Myron Darrel Montefalcon and Jay Rhald Padilla and Lany Maceda and Mideth Abisado and Joseph Marvin Imperial},
  journal= {arXiv preprint arXiv:2310.00679},
  year   = {2023}
}

备注

Accepted for PACLIC2023