中文

国家数字图书馆的落地实践:挪威 Transformer 模型之例

计算与语言 2021-04-21 v1 数字图书馆

摘要

本工作中,我们展示了从国家图书馆的数字与数字化馆藏构建大规模训练集的过程。所得到的基于双向编码器表示从 Transformers(BERT)的挪威语语言模型,在挪威博克莫尔语(Bokmål)与挪威尼诺斯克语(Nynorsk)的若干词元与序列分类任务中均优于多语 BERT(mBERT)模型。我们的模型也提升了语料中其他语言如英语、瑞典语和丹麦语的 mBERT 性能。对于未包含在语料中的语言,权重适度退化同时保持较强的多语特性。因此,我们表明在记忆机构内利用含一定噪声的光学字符识别(OCR)内容构建高质量模型是可行的,并希望为其他记忆机构效仿铺平道路。

关键词

引用

@article{arxiv.2104.09617,
  title  = {Operationalizing a National Digital Library: The Case for a Norwegian Transformer Model},
  author = {Per E Kummervold and Javier de la Rosa and Freddy Wetjen and Svein Arne Brygfjeld},
  journal= {arXiv preprint arXiv:2104.09617},
  year   = {2021}
}

备注

Accepted to NoDaLiDa 2021