中文

面向广覆盖命名实体资源:一种针对多种多样语言的数据高效方法

计算与语言 2022-05-02 v2

摘要

平行语料库是提取多语言命名实体(MNE)资源的理想选择,即一个将名称翻译为多种语言的数据集。先前从平行语料库中提取 MNE 数据集的工作需要诸如大型单语语料库或词对齐器等资源,而这些资源在低资源语言中不可用或表现不佳。我们提出 CLC-BN,一种创建 MNE 资源的新方法,并将其应用于包含超过 1000 种语言的 Parallel Bible Corpus。CLC-BN 从平行语料库统计中学习神经音译模型,无需任何其他双语资源、词对齐器或种子数据。实验结果表明 CLC-BN 明显优于先前工作。我们发布了涵盖 1340 种语言的 MNE 资源,并展示了其在两个下游任务中的有效性:知识图谱增强与双语词典归纳。

关键词

引用

@article{arxiv.2201.12219,
  title  = {Towards a Broad Coverage Named Entity Resource: A Data-Efficient Approach for Many Diverse Languages},
  author = {Silvia Severini and Ayyoob Imani and Philipp Dufter and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2201.12219},
  year   = {2022}
}

备注

LREC 2022