AMNet:面向增强中文语音合成的声学模型网络
声音
2025-04-15 v1 人工智能
音频与语音处理
摘要
本文提出 AMNet,一种面向提升中文语音合成性能的声学模型网络,通过引入短语结构标注和局部卷积模块。AMNet 基于 FastSpeech 2 架构构建,旨在解决局部上下文建模的难题,这对于捕捉停顿、重读和语调等细致语音特征至关重要。通过将短语结构解析器嵌入模型并引入局部卷积模块,AMNet 增强了模型对局部信息的敏感性。此外,AMNet 将声调特征从音素中解耦,提供语调建模的明确指导,从而提高语调准确性和发音质量。实验结果表明,AMNet 在主观和客观评估方面均优于基线模型。该模型实现了卓越的平均意见分数(MOS)、更低的梅尔倒谱失真(MCD),以及改进的基频拟合 ,证明其能够生成高质量、自然且富有表现力的中文语音。
关键词
引用
@article{arxiv.2504.09225,
title = {AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis},
author = {Yubing Cao and Yinfeng Yu and Yongming Li and Liejun Wang},
journal= {arXiv preprint arXiv:2504.09225},
year = {2025}
}
备注
Main paper (8 pages). Accepted for publication by IJCNN 2025