中文

利用异构标注改进中文语义角色标注

计算与语言 2017-03-16 v3

摘要

以往的中文语义角色标注(SRL)研究集中于单一语义标注语料库。但单一语料库的训练数据通常有限。同时,通常存在其他散布于不同标注框架下的中文 SRL 语义标注语料库。数据稀疏性仍然是一个瓶颈。这种情况需要更大的训练数据集,或能够利用高度异构数据的有效方法。在本文中,我们主要关注后者,即通过联合使用异构语料库来改进中文 SRL。我们提出了一种新颖的渐进式学习模型,该模型用门控循环适配器增强了渐进式神经网络。该模型能够容纳异构输入并在它们之间有效迁移知识。我们还为中文 SRL 发布了一个新语料库 Chinese SemBank。在 CPB 1.0 上的实验表明,我们的模型优于最先进的方法。

关键词

引用

@article{arxiv.1702.06740,
  title  = {Improving Chinese SRL with Heterogeneous Annotations},
  author = {Qiaolin Xia and Baobao Chang and Zhifang Sui},
  journal= {arXiv preprint arXiv:1702.06740},
  year   = {2017}
}

备注

This paper has been withdrawn by the author due to a crucial error in equation 10