学习者汉语的语义角色标注:句法分析与二语—母语平行数据的重要性
计算与语言
2018-08-30 v2
摘要
本文以语义角色标注(SRL)为案例任务、以学习者汉语为案例语言,研究中介语(L2)的语义解析。我们首先手动标注一组学习者文本的语义角色,得出用于自动 SRL 的黄金标准。基于新数据,我们随后评估了三种现成 SRL 系统,即基于 PCFGLA 解析器、基于神经解析器以及神经句法无关系统,以衡量学习者汉语 SRL 可达到的成功度。我们发现两个非显而易见的事实:1)在 L1 句上训练的系统在 L2 数据上表现相当糟糕;2)两个基于解析器的系统从 L1 数据到 L2 数据的性能下降小得多,表明句法解析在中介语 SRL 中的重要性。最后,本文引入一种基于一致性的模型,以挖掘大规模 L2-L1 平行数据中的语义连贯性信息。我们随后表明该信息对增强学习者文本的 SRL 非常有效。我们的模型取得了 72.06 的 F 值,比最佳基线高出 2.02 个点。
引用
@article{arxiv.1808.09409,
title = {Semantic Role Labeling for Learner Chinese: the Importance of Syntactic Parsing and L2-L1 Parallel Data},
author = {Zi Lin and Yuguang Duan and Yuanyuan Zhao and Weiwei Sun and Xiaojun Wan},
journal= {arXiv preprint arXiv:1808.09409},
year = {2018}
}
备注
EMNLP 2018