泰语共指消解数据集 ThaiCoref
计算与语言
2024-06-11 v1
摘要
尽管共指消解是自然语言处理(NLP)中一个成熟的研究领域,但由于缺乏大型标注语料,聚焦泰语的研究仍有限。本文我们介绍ThaiCoref,一个用于泰语共指消解的数据集。该数据集包含777,271个标记、44,082个提及和10,429个实体,跨四种文本类型:大学论文、报纸、演讲和维基百科。我们的标注方案基于OntoNotes基准进行调整,以解决泰语特有的现象。利用ThaiCoref,我们训练的模型采用多语言编码器和跨语言迁移技术,在测试集上获得了67.88%的最佳F1分数。错误分析揭示了泰语独特语言特征所带来的挑战。为利益社区,我们将数据集和模型公开于http://www.github.com/nlp-chula/thai-coref。
引用
@article{arxiv.2406.06000,
title = {ThaiCoref: Thai Coreference Resolution Dataset},
author = {Pontakorn Trakuekul and Wei Qi Leong and Charin Polpanumas and Jitkapat Sawatphol and William Chandra Tjhi and Attapol T. Rutherford},
journal= {arXiv preprint arXiv:2406.06000},
year = {2024}
}