英语、泰米尔语和僧伽罗语的多向平行命名实体标注语料库
计算与语言
2025-01-16 v2
摘要
本文介绍了一个英语-泰米尔语-僧伽罗语的多向平行语料库,其中标注了命名实体(NE),其中僧伽罗语和泰米尔语是低资源语言。利用预训练的多语言语言模型(mLMs),我们在此数据集上为僧伽罗语和泰米尔语建立了新的命名实体识别(NER)基准结果。我们还对不同类型mLMs的NER能力进行了详细研究。最后,我们展示了我们的NER系统在低资源神经机器翻译(NMT)任务中的实用性。我们的数据集公开于:https://github.com/suralk/multiNER。
关键词
引用
@article{arxiv.2412.02056,
title = {A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala},
author = {Surangika Ranathunga and Asanka Ranasinghea and Janaka Shamala and Ayodya Dandeniyaa and Rashmi Galappaththia and Malithi Samaraweeraa},
journal= {arXiv preprint arXiv:2412.02056},
year = {2025}
}