基于声学后验图的芬兰语发音编辑
音频与语音处理
2026-02-10 v3
摘要
合成第二语言(L2)语音在L2语言学习体验和反馈方面具有高度价值。然而,由于缺乏L2语音合成数据集,合成L2语音对于资源匮乏的语言仍然困难。本文提供了一个实用解决方案,用于编辑本地语音以近似L2语音,并提出PPG2Speech—a基于扩散模型的多说话人声学后验图到语音(Phonetic-Posteriorgrams-to-Speech)模型,能够在无需文本对齐的情况下编辑单个音素。我们采用Matcha-TTS的流匹配解码器作为骨干,将声学后验图(PPGs)转化为以外部说话人嵌入和音高为条件的梅尔频谱图。PPG2Speech通过分类自由引导(CFG)和Sway抽样强化了Matcha-TTS的流匹配解码器。我们还提出了一种新的任务特定目标评估指标——语音对齐一致性(Phonetic Aligned Consistency, PAC),用于衡量编辑后PPGs与合成语音中提取的PPGs之间的一致性。我们在约60小时数据、资源匮乏且近似无声化的芬兰语上验证了方法的有效性。我们对方法进行客观和主观评估,比较其自然度、说话人相似度和编辑效果与基于TTS的编辑方法。我们的源代码已发布于 https://github.com/aalto-speech/PPG2Speech。
关键词
引用
@article{arxiv.2507.02115,
title = {Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams},
author = {Zirui Li and Lauri Juvela and Mikko Kurimo},
journal= {arXiv preprint arXiv:2507.02115},
year = {2026}
}
备注
Accepted by Proceeding of 13th edition of the Speech Synthesis Workshop; 5 pages, 1 figure