恢复节奏:基于Transformer模型的孟加拉语标点恢复
计算与语言
2026-01-13 v2 人工智能
机器学习
摘要
标点恢复有助于提升文本可读性,是自动语音识别(ASR)后处理任务中的关键步骤,尤其对于资源匮乏的语言如孟加拉语。本研究探索了Transformer模型(具体为XLM-RoBERTa-large)用于自动恢复无标点孟加拉语文本的方法。我们聚焦于预测四种标点符号:句号、逗号、问号和感叹号,涵盖多样化文本领域。为解决标注资源稀缺的问题,我们构建了大规模且多样化的训练语料库,并应用数据增强技术。我们最佳模型在训练时采用增强因子alpha = 0.20%,在新闻测试集上达到97.1%的准确率,在参考测试集上达到91.2%的准确率,在ASR测试集上达到90.2%的准确率。结果表明,模型对参考文本和ASR转录具有强大的泛化能力,能够在实际应用中处理噪声场景。本工作为孟加拉语标点恢复奠定了坚实基线,并公开贡献了数据集和代码,以支持未来的低资源NLP研究。
引用
@article{arxiv.2507.18448,
title = {Restoring Rhythm: Punctuation Restoration Using Transformer Models for Bangla, A Low-Resource Language},
author = {Md Obyedullahil Mamun and Md Adyelullahil Mamun and Arif Ahmad and Md. Imran Hossain Emu},
journal= {arXiv preprint arXiv:2507.18448},
year = {2026}
}