中文

利用句法信息增强越南语与汉语的词分割与词性标注

计算与语言 2021-06-17 v2

摘要

词分割与词性标注是越南语自然语言处理中面向下游任务的两个关键预处理步骤。实际上,人们在进行词分割与词性标注时往往也会考虑短语边界,而非仅从左到右逐词处理。在本文中,我们通过采用一种简化的成分句法分析器来实现这一思想,以改进越南语的词分割与词性标注。我们用于联合词分割与词性标注的神经模型具有基于音节的 CRF 成分句法分析器的架构。为降低分析复杂度,我们将所有成分标签替换为单一标签以标示短语。该模型可由其他工具预测的词语边界与词性标签进行增强。由于越南语与汉语具有若干相似的语言现象,我们在三个越南语基准数据集与六个汉语基准数据集上评估了所提模型及其增强版本。实验结果表明,所提模型在两种语言上均取得了优于以往工作的性能。

关键词

引用

@article{arxiv.2102.12136,
  title  = {Augmenting Part-of-speech Tagging with Syntactic Information for Vietnamese and Chinese},
  author = {Duc-Vu Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2102.12136},
  year   = {2021}
}

备注

The comparison with existing methods in this paper is unfair because the hyper-parameters of Bi-LSTM are different compared with previous research. Importantly, there is a data leakage issue w.r.t this paper's experimental setup