中文

面向实时TTS的低延迟、上下文感知音素化的面向服务的方法

声音 2025-12-15 v1 计算与语言 音频与语音处理

摘要

轻量级、实时文本转语音系统对于无障碍至关重要。然而,最有效的TTS模型往往依赖轻量级音素化器,难以处理上下文依赖挑战。相比之下,具有更深语言理解能力的音素化器通常会产生高计算成本,导致无法实现实时性能。本文审视了G2P辅助TTS系统中音素化质量与推理速度之间的权衡,提出了一种实用框架以弥合这一鸿沟。我们提出了面向上下文感知音素化的轻量级策略,以及一种面向服务的TTS架构,将这些模块作为独立服务执行。该设计将重型上下文感知组件从核心TTS引擎中解耦,有效突破延迟障碍,使高质量音素化模型能够实现实时使用。实验结果表明,所提出的系统在保持实时响应性的同时,提高了发音质量和语言准确性,使其特别适合离线和终端设备TTS应用。

关键词

引用

@article{arxiv.2512.08006,
  title  = {Beyond Unified Models: A Service-Oriented Approach to Low Latency, Context Aware Phonemization for Real Time TTS},
  author = {Mahta Fetrat and Donya Navabi and Zahra Dehghanian and Morteza Abolghasemi and Hamid R. Rabiee},
  journal= {arXiv preprint arXiv:2512.08006},
  year   = {2025}
}