中文

SFMS-ALR:基于脚本优先和自适应区域解析的脚本-first 多语言语音合成

声音 2025-10-30 v1 人工智能 音频与语音处理

摘要

intra-sentence 多语言语音合成(code-switching TTS)由于语言突变、脚本变化以及语言之间不匹配的韵律,仍是一个主要挑战。传统 TTS 系统通常为单语言,无法在混合语言环境中生成自然、可理解的语音。我们提出 Script-First 多语言合成与自适应区域解析(SFMS-ALR),一个面向流畅、实时 code-switch 语音生成的 engine-agnostic 框架。SFMS-ALR 按 Unicode 脚本分割输入文本,应用自适应语言识别确定每个片段的语言和区域,并通过情感感知调整来规范化韵律,以保持跨语言的表达连续性。算法生成统一的 SSML 表示,包含适当的 "lang" 或 "voice" 区间,并通过单一 TTS 请求合成该语音。与端到端多语言模型不同,SFMS-ALR 无需重新训练即可无缝集成来自 Google、Apple、Amazon 等提供商的现有语音。与 Unicom 和 Mask LID 等数据驱动管道进行比较分析表明,SFMS-ALR 在灵活性、可解释性和即时部署方面具有优势。该框架为高质量、engine-independent 多语言 TTS 建立了模块化基线,并概述了用于 intelligibility、naturalness 和 user preference 的评估策略。

关键词

引用

@article{arxiv.2510.25178,
  title  = {SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution},
  author = {Dharma Teja Donepudi},
  journal= {arXiv preprint arXiv:2510.25178},
  year   = {2025}
}

备注

10 pages, 2 figures, 1 table. Demonstration prototype available at https://sfml-tts-proxy-253495793487.us-central1.run.app