中文

HiligayNER:希利盖农语命名实体识别基线模型

计算与语言 2025-10-14 v1

摘要

希利盖农语主要由菲律宾班乃岛、西内格罗斯省和索科斯克萨根地区的人民使用,由于缺乏标注语料库和基线模型,该语言在语言处理研究中仍然代表性不足。本研究介绍了HiligayNER,这是第一个公开可用的希利盖农语命名实体识别(NER)基线模型。用于构建HiligayNER的数据集包含超过8000个标注句子,收集自公开可用的新闻文章、社交媒体帖子和文学作品。两个基于Transformer的模型,mBERT和XLM-RoBERTa,在此收集的语料库上进行了微调,以构建HiligayNER的版本。评估结果显示性能强劲,两个模型在各类实体上的精确率、召回率和F1分数均超过80%。此外,与宿务语和他加禄语的跨语言评估显示了有前景的可迁移性,表明HiligayNER在低资源环境中对多语言NLP具有更广泛的适用性。这项工作旨在为代表性不足的菲律宾语言(特别是希利盖农语)的语言技术发展做出贡献,并支持区域语言处理的未来研究。

关键词

引用

@article{arxiv.2510.10776,
  title  = {HiligayNER: A Baseline Named Entity Recognition Model for Hiligaynon},
  author = {James Ald Teves and Ray Daniel Cal and Josh Magdiel Villaluz and Jean Malolos and Mico Magtira and Ramon Rodriguez and Mideth Abisado and Joseph Marvin Imperial},
  journal= {arXiv preprint arXiv:2510.10776},
  year   = {2025}
}

备注

Camera-ready for PACLIC 2025 (ACL Proceedings)