从平行电影字幕构建希伯来语语义角色标注词汇资源
计算与语言
2020-05-19 v1
摘要
我们呈现了一个通过从英语进行标注投影半自动构建的希伯来语语义角色标注资源。该语料源自多语言 OpenSubtitles 数据集,包含简短的非正式句子,并已计算出可靠的语言学标注。我们提供了数据的完整标注版本,包括形态分析、依存句法以及 FrameNet 与 PropBank 风格的语义角色标注。句子在英希之间对齐,两侧均含完整标注以及从英语论元到希伯来语论元的显式映射。我们在该希伯来语资源上训练了一个神经 SRL 模型,利用了预训练的多语言 BERT transformer 模型,并提供了首个可用的希伯来语 SRL 基线模型作为参考点。我们提供的代码具有通用性,可适配其他语言以引导构建 SRL 资源。
引用
@article{arxiv.2005.08206,
title = {Building a Hebrew Semantic Role Labeling Lexical Resource from Parallel Movie Subtitles},
author = {Ben Eyal and Michael Elhadad},
journal= {arXiv preprint arXiv:2005.08206},
year = {2020}
}
备注
9 pages, 7 figures, accepted to LREC 2020