希伯来语 NLP 的问题何在?又该如何修正
计算与语言
2019-08-16 v1
摘要
对于英语等形态简单的语言,spaCy 或斯坦福 CoreNLP 等自动标注流水线成功地服务于学术界与工业界的项目。对于许多形态丰富语言(MRLs),类似流水线表现出次优性能,限制了其在研究与工业文本分析中的适用性。该次优性能主要源于早期形态消歧决策中的错误,这些错误无法在流水线后续阶段被纠正,从而导致整体标注的不一致。本文描述 Onlp 套件的设计与使用,这是一个用于处理现代希伯来语文本的联合形态-句法解析框架。形态与句法的联合推断大幅限制了错误传播,并带来高准确率。Onlp 提供丰富且具表达力的输出,已服务于多样的学术与商业需求。其配套的在线演示进一步服务于教育活动,向研究人员与非研究人员介绍希伯来语 NLP 的复杂性。
引用
@article{arxiv.1908.05453,
title = {What's Wrong with Hebrew NLP? And How to Make it Right},
author = {Reut Tsarfaty and Amit Seker and Shoval Sadde and Stav Klein},
journal= {arXiv preprint arXiv:1908.05453},
year = {2019}
}