中文

BenCoref:名词短语与代词指称标注的多领域数据集

计算与语言 2023-07-06 v3

摘要

共指消解是自然语言处理(NLP)中一个被广泛研究的问题。尽管在英语及其他资源丰富的语言中已被广泛研究,但由于缺乏相关数据集,孟加拉语共指消解研究在很大程度上仍待探索。孟加拉语作为低资源语言,相较于英语表现出更高的形态丰富性。在本文中,我们引入一个新数据集 BenCoref,包含从四个不同领域收集的孟加拉语文本共指标注。这一相对较小的数据集在 48,569 个词符中包含 5200 个提及标注,形成 502 个提及簇。我们描述了该数据集的创建过程,并报告了使用 BenCoref 训练的多个模型的性能。我们期望我们的工作能为孟加拉语中跨多个领域的共指现象差异提供有价值的见解,并鼓励开发更多孟加拉语资源。此外,我们发现从英语到孟加拉语的零样本跨语言性能较差,凸显了为此任务开发更多语言特定资源的必要性。

关键词

引用

@article{arxiv.2304.03682,
  title  = {BenCoref: A Multi-Domain Dataset of Nominal Phrases and Pronominal Reference Annotations},
  author = {Shadman Rohan and Mojammel Hossain and Mohammad Mamun Or Rashid and Nabeel Mohammed},
  journal= {arXiv preprint arXiv:2304.03682},
  year   = {2023}
}