基于微调 KB-BERT 的瑞典语标点恢复
计算与语言
2022-02-15 v1 人工智能
机器学习
摘要
本文提出一种使用 BERT 模型进行瑞典语自动标点恢复的方法。该方法基于 KB-BERT,这是由瑞典国家图书馆在瑞典语语料上预训练的一个公开可用的神经网络语言模型。随后使用政府文本语料对该模型针对此特定任务进行微调。以全小写且无标点的瑞典语文本作为输入,模型应返回一份语法正确的带标点文本副本作为输出。该问题的成功解决可为一系列 NLP 领域带来益处,如语音转文本和自动文本。由于分号等较罕见标点的数据缺乏,本项目仅考虑句号、逗号和问号。此外,某些标点与更常见的标点可互换,如感叹号和句号。因此,数据集将所有感叹号替换为句号。微调后的瑞典语 BERT 模型被称为 prestoBERT,取得了 78.9 的总体 F1 分数。所提模型得分与国际同类模型相近,匈牙利语和中文模型分别取得 82.2 和 75.6 的 F1 分数。作为进一步比较,进行了一项人工评估案例研究。人工测试组取得 81.7 的总体 F1 分数,但在句号和逗号上得分明显差于 prestoBERT。检查模型和人工输出的句子显示结果令人满意,尽管 F1 分数存在差异。这种脱节似乎源于不必要地专注于复制测试集中完全相同的标点,而非提供任意多种正确解释之一。如果损失函数可以重写以奖励所有语法正确的输出,而非仅奖励原始单一示例,则 prestoBERT 和人工组的性能都可能显著提升。
引用
@article{arxiv.2202.06769,
title = {Punctuation restoration in Swedish through fine-tuned KB-BERT},
author = {John Björkman Nilsson},
journal= {arXiv preprint arXiv:2202.06769},
year = {2022}
}