基于 Transformer 的波兰语文本标点预测
计算与语言
2024-10-08 v1
摘要
语音识别系统通常输出缺乏标点符号的文本。然而,标点符号对于文本理解至关重要。为解决此问题,开发了标点预测模型。本文描述了为 Poleval 2022 Task 1:波兰语文本标点预测解决方案,得分为 71.44 加权 F1。该方法利用单个 HerBERT 模型在竞赛数据和外部数据集上进行微调。
关键词
引用
@article{arxiv.2410.04621,
title = {Punctuation Prediction for Polish Texts using Transformers},
author = {Jakub Pokrywka},
journal= {arXiv preprint arXiv:2410.04621},
year = {2024}
}