中文

AMNet:面向增强中文语音合成的声学模型网络

声音 2025-04-15 v1 人工智能 音频与语音处理

摘要

本文提出 AMNet,一种面向提升中文语音合成性能的声学模型网络,通过引入短语结构标注和局部卷积模块。AMNet 基于 FastSpeech 2 架构构建,旨在解决局部上下文建模的难题,这对于捕捉停顿、重读和语调等细致语音特征至关重要。通过将短语结构解析器嵌入模型并引入局部卷积模块,AMNet 增强了模型对局部信息的敏感性。此外,AMNet 将声调特征从音素中解耦,提供语调建模的明确指导,从而提高语调准确性和发音质量。实验结果表明,AMNet 在主观和客观评估方面均优于基线模型。该模型实现了卓越的平均意见分数(MOS)、更低的梅尔倒谱失真(MCD),以及改进的基频拟合 F0(R2)F0 (R^2),证明其能够生成高质量、自然且富有表现力的中文语音。

关键词

引用

@article{arxiv.2504.09225,
  title  = {AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis},
  author = {Yubing Cao and Yinfeng Yu and Yongming Li and Liejun Wang},
  journal= {arXiv preprint arXiv:2504.09225},
  year   = {2025}
}

备注

Main paper (8 pages). Accepted for publication by IJCNN 2025