中文

PersianPunc:面向波斯文标点恢复的大规模数据集与 BERT 方法

计算与语言 2026-03-06 v1 人工智能

摘要

标点恢复是提高自动语音识别(ASR)输出可读性和下游效用的关键技术,但尽管重要性不言而喻,波斯语仍然未得到充分探索。我们引入 PersianPunc,一个规模为1700万样本的大规模高质量波斯文标点恢复数据集,通过系统性地聚合和过滤现有文本资源构建而成。我们将标点恢复建模为 token 级别的序列标注任务,并对 ParsBERT 进行微调以实现卓越性能。通过比较评估,我们展示了虽然大型语言模型能够进行标点恢复,但它们存在关键局限性:倾向于过度纠正,引入超出标点插入的不需要的编辑( particularly problematic for speech-to-text pipelines),并且计算要求显著更高。我们的轻量级 BERT 方法在测试集上实现了91.33%的宏平均 F1 分数,同时保持适用于实时应用程序的效率。我们将数据集(https://huggingface.co/datasets/MohammadJRanjbar/persian-punctuation-restoration)和模型(https://huggingface.co/MohammadJRanjbar/parsbert-persian-punctuation)公开,旨在促进波斯语 NLP 领域的未来研究,并为其他形态复杂的低资源语言提供可扩展框架。

关键词

引用

@article{arxiv.2603.05314,
  title  = {PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration},
  author = {Mohammad Javad Ranjbar Kalahroodi and Heshaam Faili and Azadeh Shakery},
  journal= {arXiv preprint arXiv:2603.05314},
  year   = {2026}
}