利用异构标注改进中文语义角色标注
计算与语言
2017-03-16 v3
摘要
以往的中文语义角色标注(SRL)研究集中于单一语义标注语料库。但单一语料库的训练数据通常有限。同时,通常存在其他散布于不同标注框架下的中文 SRL 语义标注语料库。数据稀疏性仍然是一个瓶颈。这种情况需要更大的训练数据集,或能够利用高度异构数据的有效方法。在本文中,我们主要关注后者,即通过联合使用异构语料库来改进中文 SRL。我们提出了一种新颖的渐进式学习模型,该模型用门控循环适配器增强了渐进式神经网络。该模型能够容纳异构输入并在它们之间有效迁移知识。我们还为中文 SRL 发布了一个新语料库 Chinese SemBank。在 CPB 1.0 上的实验表明,我们的模型优于最先进的方法。
引用
@article{arxiv.1702.06740,
title = {Improving Chinese SRL with Heterogeneous Annotations},
author = {Qiaolin Xia and Baobao Chang and Zhifang Sui},
journal= {arXiv preprint arXiv:1702.06740},
year = {2017}
}
备注
This paper has been withdrawn by the author due to a crucial error in equation 10