中文

丹麦十亿词项目

计算与语言 2021-05-14 v3

摘要

丹麦语言技术一直受限于缺乏现代 NLP 所偏好的广覆盖大规模语料库。本文描述丹麦十亿词语料库(Danish Gigaword Corpus),这是一项专注努力的成果,旨在提供一个多样且自由可用的十亿词丹麦语文本语料库。丹麦十亿词语料库涵盖广泛的时间周期、领域、说话者社会经济地位以及丹麦方言。

关键词

引用

@article{arxiv.2005.03521,
  title  = {The Danish Gigaword Project},
  author = {Leon Strømberg-Derczynski and Manuel R. Ciosici and Rebekah Baglini and Morten H. Christiansen and Jacob Aarup Dalsgaard and Riccardo Fusaroli and Peter Juel Henrichsen and Rasmus Hvingelby and Andreas Kirkedal and Alex Speed Kjeldsen and Claus Ladefoged and Finn Årup Nielsen and Malte Lau Petersen and Jonathan Hvithamar Rystrøm and Daniel Varab},
  journal= {arXiv preprint arXiv:2005.03521},
  year   = {2021}
}

备注

Identical to the NoDaLiDa 2021 version