MSNER:面向命名实体识别的多语言语音数据集
计算与语言
2024-05-21 v1 机器学习
摘要
命名实体识别(NER)在基于文本的任务中得到了广泛探索,但在口语理解中仍基本被忽视。现有资源仅限于单一的英语数据集。本文通过引入MSNER(一个免费可用的、带有命名实体标注的多语言语音语料库)来填补这一空白。它为四种语言(荷兰语、法语、德语和西班牙语)的VoxPopuli数据集提供了标注。我们还发布了一个高效的标注工具,该工具利用自动预标注来加速手动精化。这产生了590小时和15小时的银标准标注语音用于训练和验证,以及一个17小时的手动标注评估集。我们进一步提供了银标准与金标准标注的比较分析。最后,我们提供了基线NER模型,以促进对这一新数据集的进一步研究。
引用
@article{arxiv.2405.11519,
title = {MSNER: A Multilingual Speech Dataset for Named Entity Recognition},
author = {Quentin Meeus and Marie-Francine Moens and Hugo Van hamme},
journal= {arXiv preprint arXiv:2405.11519},
year = {2024}
}