面向实时TTS的低延迟、上下文感知音素化的面向服务的方法
声音
2025-12-15 v1 计算与语言
音频与语音处理
摘要
轻量级、实时文本转语音系统对于无障碍至关重要。然而,最有效的TTS模型往往依赖轻量级音素化器,难以处理上下文依赖挑战。相比之下,具有更深语言理解能力的音素化器通常会产生高计算成本,导致无法实现实时性能。本文审视了G2P辅助TTS系统中音素化质量与推理速度之间的权衡,提出了一种实用框架以弥合这一鸿沟。我们提出了面向上下文感知音素化的轻量级策略,以及一种面向服务的TTS架构,将这些模块作为独立服务执行。该设计将重型上下文感知组件从核心TTS引擎中解耦,有效突破延迟障碍,使高质量音素化模型能够实现实时使用。实验结果表明,所提出的系统在保持实时响应性的同时,提高了发音质量和语言准确性,使其特别适合离线和终端设备TTS应用。
引用
@article{arxiv.2512.08006,
title = {Beyond Unified Models: A Service-Oriented Approach to Low Latency, Context Aware Phonemization for Real Time TTS},
author = {Mahta Fetrat and Donya Navabi and Zahra Dehghanian and Morteza Abolghasemi and Hamid R. Rabiee},
journal= {arXiv preprint arXiv:2512.08006},
year = {2025}
}