NERCat:针对加泰罗尼亚语命名实体识别的增强微调
计算与语言
2025-03-19 v1
摘要
命名实体识别(NER)是自然语言处理(NLP)中从非结构化文本中提取结构化信息的关键组成部分。然而,对于加泰罗尼亚语等低资源语言,NER系统的性能往往因缺乏高质量标注数据集而受损。本文介绍了NERCat,即GLiNER模型的一个微调版本,旨在改善加泰罗尼亚语文本的NER性能。我们使用手动标注的加泰罗尼亚语电视转录数据集对模型进行训练和微调,聚焦于政治、体育和文化等领域。评估结果表明,在精度、召回率和F1分数方面取得了显著提升,特别是在法律、产品和设施等代表性不足的命名实体类别上。本研究证明了领域特定微调在低资源语言中的有效性,并突出了通过手动标注和高质量数据集增强加泰罗尼亚语NLP应用的潜力。
引用
@article{arxiv.2503.14173,
title = {NERCat: Fine-Tuning for Enhanced Named Entity Recognition in Catalan},
author = {Guillem Cadevall Ferreres and Marc Serrano Sanz and Marc Bardeli Gámez and Pol Gerdt Basullas and Francesc Tarres Ruiz and Raul Quijada Ferrero},
journal= {arXiv preprint arXiv:2503.14173},
year = {2025}
}
备注
7 pages, 1 table