中文

X-SRL:一个并行跨语言语义角色标注数据集

计算与语言 2020-10-06 v1

摘要

尽管语义角色标注(SRL)已在多种语言中得到研究,但主要改进多集中于资源更丰富的英语。事实上,现有的多语言 SRL 数据集包含不一致的标注风格或来自不同领域,阻碍了多语言学习中的泛化。在本工作中,我们提出一种自动构建并行 SRL 语料库的方法,该语料库在英语、法语、德语、西班牙语四种语言中平行,并具有跨语言完全可比的统一谓语与角色标注。我们对英语 CoNLL-09 数据集应用高质量机器翻译,并使用多语言 BERT 将其高质量标注投影到目标语言。我们包含经人工验证的测试集以衡量投影质量,并表明投影比强基线更稠密且更精确。最后,我们在新语料库上训练不同的 SOTA 模型用于单语言与多语言 SRL,显示多语言标注尤其改善了较弱语言的性能。

关键词

引用

@article{arxiv.2010.01998,
  title  = {X-SRL: A Parallel Cross-Lingual Semantic Role Labeling Dataset},
  author = {Angel Daza and Anette Frank},
  journal= {arXiv preprint arXiv:2010.01998},
  year   = {2020}
}

备注

To be presented at the EMNLP 2020 Conference