中文

六种语言的开放字幕释义语料库

计算与语言 2018-09-18 v1

摘要

本文伴随 Opusparcus 的发布,这是一个面向六种欧洲语言的新释义语料库:德语、英语、芬兰语、法语、俄语和瑞典语。该语料库由释义组成,即同一语言中意义大致相同的句子对。释义提取自 OpenSubtitles2016 语料库,其中包含电影和电视节目的字幕。字幕中出现的非正式与口语化语体使此类数据成为非常有趣的语言资源,例如从计算机辅助语言学习的视角看。对于每种目标语言,Opusparcus 数据已被划分为三类数据集:训练、开发和测试集。训练集规模庞大,由数百万句子对组成,并借助概率排序函数自动编译。开发和测试集由经人工核查的句子对组成;每个集合包含约 1000 个经两位标注者验证为可接受释义的句子对。

关键词

引用

@article{arxiv.1809.06142,
  title  = {Open Subtitles Paraphrase Corpus for Six Languages},
  author = {Mathias Creutz},
  journal= {arXiv preprint arXiv:1809.06142},
  year   = {2018}
}