中文

基于 Transformer 的波兰语文本标点预测

计算与语言 2024-10-08 v1

摘要

语音识别系统通常输出缺乏标点符号的文本。然而,标点符号对于文本理解至关重要。为解决此问题,开发了标点预测模型。本文描述了为 Poleval 2022 Task 1:波兰语文本标点预测解决方案,得分为 71.44 加权 F1。该方法利用单个 HerBERT 模型在竞赛数据和外部数据集上进行微调。

关键词

引用

@article{arxiv.2410.04621,
  title  = {Punctuation Prediction for Polish Texts using Transformers},
  author = {Jakub Pokrywka},
  journal= {arXiv preprint arXiv:2410.04621},
  year   = {2024}
}