中文

尼日利亚皮钦语的隐式话语关系分类

计算与语言 2024-11-05 v2

摘要

尽管试图使大型语言模型多语言化,世界上许多语言仍然严重资源不足。这扩大了面向资金充足语言与面向资源匮乏语言的 NLP 和 AI 应用之间的性能差距。本文中,我们聚焦于尼日利亚皮钦语(NP),该语言有近一亿使用者,但 NLP 资源和语料库相对非常少。我们处理隐式话语关系分类(IDRC)任务,并系统比较了两种方法:一种是将 NP 数据翻译成英语,然后使用资源丰富的 IDRC 工具并反向投影标签;另一种是为 NP 创建合成话语语料库,其中我们翻译 PDTB 并投影 PDTB 标签,然后训练一个 NP IDR 分类器。后一种学习“原生”NP 分类器的方法在 4 路和 11 路分类的 f1_{1} 分数上分别比基线高出 13.27% 和 33.98%。

关键词

引用

@article{arxiv.2406.18776,
  title  = {Implicit Discourse Relation Classification For Nigerian Pidgin},
  author = {Muhammed Saeed and Peter Bourgonje and Vera Demberg},
  journal= {arXiv preprint arXiv:2406.18776},
  year   = {2024}
}