越南语大小写恢复与标点恢复模型
计算与语言
2022-07-05 v1
摘要
尽管近期自动语音识别(ASR)的性能方法不断涌现,此类方法并不能保证其输出具有正确的大小写与标点。该问题对自然语言处理(NLP)算法的理解以及人工处理均有显著影响。大小写与标点恢复在原始文本输入的预处理流程中必不可少。对于越南语等低资源语言,该任务的公开数据集十分匮乏。本文贡献了一个面向越南语大小写与标点恢复的公开数据集,并提出了一种名为 JointCapPunc 的联合任务模型。在越南语数据集上的实验结果表明,与单任务模型及此前的联合学习模型相比,我们的联合模型更为有效。我们在 https://github.com/anhtunguyen98/JointCapPunc 公开发布了数据集与模型实现。
引用
@article{arxiv.2207.01312,
title = {Vietnamese Capitalization and Punctuation Recovery Models},
author = {Hoang Thi Thu Uyen and Nguyen Anh Tu and Ta Duc Huy},
journal= {arXiv preprint arXiv:2207.01312},
year = {2022}
}
备注
Accepted at Interspeech 2022