中文

CaMEL:无标签格标记提取

计算与语言 2022-03-29 v2

摘要

我们引入了 CaMEL(无标签格标记提取),这是计算形态学中一个新颖且具有挑战性的任务,尤其适用于低资源语言。我们提出了 CaMEL 的第一个模型,该模型利用一个大规模多语言语料库,仅基于一个名词短语分块器和一个对齐系统,就能提取 83 种语言的格标记。为了评估 CaMEL,我们从 UniMorph 自动构建了一个银标准。我们的模型提取出的格标记可用于检测和可视化不同语言格系统之间的相似性与差异,以及为那些没有显性格标记的语言标注细粒度的深层格。

关键词

引用

@article{arxiv.2203.10010,
  title  = {CaMEL: Case Marker Extraction without Labels},
  author = {Leonie Weissweiler and Valentin Hofmann and Masoud Jalili Sabet and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2203.10010},
  year   = {2022}
}

备注

ACL 2022