MariNER:用于历史巴西葡萄牙语命名实体识别的数据集
计算与语言
2025-07-01 v1
摘要
命名实体识别(NER)是一种 fundamental 的自然语言处理(NLP)任务,旨在识别和分类文本中不同类别的实体提及。虽然诸如英语等语言在该任务方面拥有大量高质量资源,但巴西葡萄牙语在 gold 标准 NER 数据集的数量方面仍有不足,尤其是针对特定领域。尤其值得注意的是,本文考虑到在数字人文学情境下进行 NER 对分析历史文本的重要性。为填补这一差距,本工作概述了 MariNER 数据集的构建:\textit{Mapeamento e Anota\c{c}\~oes de Registros hIst\'oricos para NER}(用于 NER 的历史记录映射和标注),这是第一个针对20世纪初巴西葡萄牙语的 gold 标准数据集,包含超过 9000 个手动标注的句子。我们还评估并比较了针对该数据集的主流 NER 模型性能。
引用
@article{arxiv.2506.23051,
title = {MariNER: A Dataset for Historical Brazilian Portuguese Named Entity Recognition},
author = {João Lucas Luz Lima Sarcinelli and Marina Lages Gonçalves Teixeira and Jade Bortot de Paiva and Diego Furtado Silva},
journal= {arXiv preprint arXiv:2506.23051},
year = {2025}
}