构建他加禄语命名实体识别数据集
计算与语言
2023-11-14 v1
摘要
我们呈现了他加禄语命名实体识别(NER)数据集的构建。该语料有助于填补当今菲律宾语言资源匮乏的缺口,其中 NER 资源尤为稀缺。文本取自包含新闻报道的预训练语料,由母语者以迭代方式标注。所得数据集包含约 7.8k 篇文档,涵盖三类实体:人物、组织与地点。标注者间一致性以 Cohen's 衡量为 0.81。我们还在监督与迁移学习设定下对最先进方法进行了广泛的实证评估。最后,我们公开发布了数据与处理代码,以启发未来的他加禄语 NLP 工作。
引用
@article{arxiv.2311.07161,
title = {Developing a Named Entity Recognition Dataset for Tagalog},
author = {Lester James V. Miranda},
journal= {arXiv preprint arXiv:2311.07161},
year = {2023}
}
备注
To be published in The First Workshop for Southeast Asian Language Processing 2023 at IJCNLP-AACL