中文

无泪的形态丰富语言解析:以希伯来语为例

计算与语言 2024-03-12 v1

摘要

句法解析仍然是关系抽取和信息抽取的关键工具,特别是在缺乏大语言模型 (LLMs) 的资源匮乏语言中。然而,在形态丰富语言 (MRLs) 中,解析器需要在每个词符中识别多个词汇单元,现有系统在延迟和设置复杂性方面表现不佳。有些系统采用流水线逐层剥离:先分词,再形态标注,最后句法解析;但这会导致早期层的错误向前传播。另一些系统则采用联合架构一次性评估所有排列;虽然这提高了准确率,但众所周知速度缓慢。相比之下,我们以希伯来语为测试案例,提出了一种新的“翻转流水线”:决策直接由专家分类器在整词单元上做出,每个分类器专用于一项特定任务。这些分类器相互独立,仅在最后合成它们的预测。这种极快的方法在希伯来语词性标注和依存句法解析方面确立了新的 SOTA,同时在其他希伯来语 NLP 任务上也达到了接近 SOTA 的性能。由于我们的架构不依赖任何特定语言的资源,它可作为开发其他 MRLs 类似解析器的模型。

关键词

引用

@article{arxiv.2403.06970,
  title  = {MRL Parsing Without Tears: The Case of Hebrew},
  author = {Shaltiel Shmidman and Avi Shmidman and Moshe Koppel and Reut Tsarfaty},
  journal= {arXiv preprint arXiv:2403.06970},
  year   = {2024}
}