PolyNorm:基于少样本大语言模型的文本到语音文本归一化
计算与语言
2025-11-06 v1 机器学习
摘要
文本归一化(Text Normalization, TN)是文本到语音(Text-to-Speech, TTS)系统中的关键预处理步骤,负责将书面形式转换为其规范的口语等价形式。传统 TN 系统虽可达到较高准确率,但工程投入巨大、难以扩展,且在语言覆盖方面存在挑战,尤其是在低资源场景下。我们提出 PolyNorm,一种基于提示(prompt-based)的大语言模型(LLM)文本归一化方法,旨在减少对手工编写规则的依赖,并以最小的人工干预实现更广泛的语言适用性。此外,我们还提出一种语言无关的自动数据整理与评估流水线,旨在支持跨多种语言的可扩展实验。在八种语言上的实验表明,相较于一个生产级基线系统,词错误率(WER)取得了持续稳定的下降。为支持后续研究,我们发布了 PolyNorm-Benchmark,一个涵盖多种文本归一化现象的多语言数据集。
引用
@article{arxiv.2511.03080,
title = {PolyNorm: Few-Shot LLM-Based Text Normalization for Text-to-Speech},
author = {Michel Wong and Ali Alshehri and Sophia Kao and Haotian He},
journal= {arXiv preprint arXiv:2511.03080},
year = {2025}
}
备注
9 pages including appendix. EMNLP 2025 Industry Track