在瑞典国家图书馆玩转词语——打造一个瑞典语 BERT
计算与语言
2020-07-06 v1
摘要
本文介绍了由 KBLab 为瑞典国家图书馆(KB)数据驱动研究而开发的瑞典语 BERT("KB-BERT")。基于近期为英语以外语言创建基于 transformer 的 BERT 模型的努力,我们说明了如何利用 KB 的馆藏创建并训练一个针对瑞典语的新语言特定 BERT 模型。我们还给出了我们的模型与现有模型——主要是瑞典公共就业服务机构 Arbetsförmedlingen 所产出的模型以及 Google 的多语 M-BERT——的对比结果,其中我们证明 KB-BERT 在从命名实体识别(NER)到词性标注(POS)的一系列 NLP 任务中优于这些模型。我们的讨论强调了由于诸如瑞典语等较小语言缺乏训练数据和测试基准而持续存在的困难。我们在此发布我们的模型以供进一步探索与研究:https://github.com/Kungbib/swedish-bert-models 。
引用
@article{arxiv.2007.01658,
title = {Playing with Words at the National Library of Sweden -- Making a Swedish BERT},
author = {Martin Malmsten and Love Börjeson and Chris Haffenden},
journal= {arXiv preprint arXiv:2007.01658},
year = {2020}
}