芬兰境内不同瑞典语方言的归一化
计算与语言
2020-12-11 v1
摘要
我们的研究提出了一种覆盖六个地区的芬兰瑞典语不同方言的方言归一化方法。我们测试了5种不同的模型,最佳模型将词错误率从76.45降至28.58。与早前关于芬兰语方言的研究结果相反,我们发现以每次一个词的方式训练模型取得了最佳结果。我们认为这归因于该模型可用训练数据的规模。我们的模型作为一个Python包可获取。该研究提供了关于这些方法在不同语境中适应性的重要信息,并为进一步研究给出了重要基线。
引用
@article{arxiv.2012.05318,
title = {Normalization of Different Swedish Dialects Spoken in Finland},
author = {Mika Hämäläinen and Niko Partanen and Khalid Alnajjar},
journal= {arXiv preprint arXiv:2012.05318},
year = {2020}
}
备注
In Proceedings of the 4th ACM SIGSPATIAL Workshop on Geospatial Humanities (GeoHumanities'20)