面向TTS和NLP应用的越南文本规范化开源库VietNormalizer
计算与语言
2026-03-05 v1 神经与进化计算
摘要
我们介绍VietNormalizer1,一个面向文本转语音(TTS)和自然语言处理(NLP)应用的开源、零依赖Python库,用于越南文本规范化。越南文本规范化是关键但尚未得到充分关注的预处理步骤:真实世界的越南文本密集地包含非标准词汇(NSWs),包括数字、日期、时间、货币金额、百分比、缩写词和外语术语,这些都必须在TTS合成或下游语言处理之前转换为可完整发音的越南词汇。现有的越南文本规范化工具要么需要重型神经网络依赖,仅覆盖NSW类的狭窄子集,要么嵌入在更大的NLP工具包中,无法独立安装。VietNormalizer通过统一的基于规则的管道解决了这些差距:(1)将任意整数、小数和大数转换为越南词汇;(2)将日期和时间规范化为其口语越南形式;(3)处理VND和USD货币金额;(4)扩展百分比;(5)通过可自定义的CSV词典解析缩写词;(6)将非越南外来词汇和外语术语转写为越南语音近似;(7)执行Unicode规范化和emoji/特殊字符删除。所有正则表达式模式在初始化时预编译,实现高吞吐量的批量处理,最小化内存开销,无需GPU或外部API依赖。该库可通过pip install vietnormalizer安装,已发布在PyPI和GitHub上,链接为https://github.com/nghimestudio/vietnormalizer,采用MIT许可证。我们讨论了设计决策、现有方法的局限性以及基于规则的规范化范式对其他低资源语音和屈折语言的普遍适用性。
引用
@article{arxiv.2603.04145,
title = {VietNormalizer: An Open-Source, Dependency-Free Python Library for Vietnamese Text Normalization in TTS and NLP Applications},
author = {Hung Vu Nguyen and Loan Do and Thanh Ngoc Nguyen and Ushik Shrestha Khwakhali and Thanh Pham and Vinh Do and Charlotte Nguyen and Hien Nguyen},
journal= {arXiv preprint arXiv:2603.04145},
year = {2026}
}
备注
10 pages, 1 table