使用正则表达式对立陶宛语文本进行规范化
计算与语言
2024-01-02 v2
摘要
文本规范化是任何文本到语音合成系统不可或缺的一部分。在自然语言文本中,存在诸如数字、日期、缩写等属于其他符号类的元素。它们被称为非标准词(NSW),需要扩展为普通词汇。为此,有必要识别每个NSW的符号类。本文提出了适用于立陶宛语的符号类分类法。基于正则表达式创建了用于检测和扩展NSW的规则集。使用三个完全不同的数据集进行了实验,并评估了准确性。解释了错误原因,并给出了开发文本规范化规则的建议。
引用
@article{arxiv.2312.17660,
title = {Normalization of Lithuanian Text Using Regular Expressions},
author = {Pijus Kasparaitis},
journal= {arXiv preprint arXiv:2312.17660},
year = {2024}
}
备注
21 pages