中文

使用正则表达式对立陶宛语文本进行规范化

计算与语言 2024-01-02 v2

摘要

文本规范化是任何文本到语音合成系统不可或缺的一部分。在自然语言文本中,存在诸如数字、日期、缩写等属于其他符号类的元素。它们被称为非标准词(NSW),需要扩展为普通词汇。为此,有必要识别每个NSW的符号类。本文提出了适用于立陶宛语的符号类分类法。基于正则表达式创建了用于检测和扩展NSW的规则集。使用三个完全不同的数据集进行了实验,并评估了准确性。解释了错误原因,并给出了开发文本规范化规则的建议。

关键词

引用

@article{arxiv.2312.17660,
  title  = {Normalization of Lithuanian Text Using Regular Expressions},
  author = {Pijus Kasparaitis},
  journal= {arXiv preprint arXiv:2312.17660},
  year   = {2024}
}

备注

21 pages