中文

ParsiNorm:面向语音处理规范化的波斯语工具包

音频与语音处理 2021-12-16 v2 计算与语言 机器学习

摘要

一般而言,语音处理模型由语言模型与声学模型组成。无论语言模型的复杂度和变体如何,语言模型都需要三个关键的预处理步骤:清洗、规范化和分词。在上述步骤中,规范化步骤对于纯文本应用中的格式统一至关重要。然而,对于语音处理模块中嵌入的语言模型,规范化不仅限于格式统一,还须将每个可读符号、数字等转换为其发音形式。据我们所知,目前尚无面向语音处理模块中嵌入语言模型的波斯语规范化工具包,因此本文提出一个开源的语音应用文本处理规范化工具包。简而言之,我们考虑不同的可读波斯语文本,如符号(常见货币、#、@、URL等)、数字(日期、时间、电话号码、国家代码等)等。与其他可用的波斯语文本规范化工具的比较表明,所提方法在语音处理中具有优越性。此外,将模型在其中一个所提功能(句子分割)上的性能与HAZM、Parsivar等其他常见自然语言处理库进行比较,表明所提方法性能良好。对其在部分波斯语维基百科数据上的评估也证实了该方法的良好性能。

关键词

引用

@article{arxiv.2111.03470,
  title  = {ParsiNorm: A Persian Toolkit for Speech Processing Normalization},
  author = {Romina Oji and Seyedeh Fatemeh Razavi and Sajjad Abdi Dehsorkh and Alireza Hariri and Hadi Asheri and Reshad Hosseini},
  journal= {arXiv preprint arXiv:2111.03470},
  year   = {2021}
}