基于隐式与显式声学特征条件的洛尔德说话风格语音转换
声音
2025-07-15 v1 计算与语言
音频与语音处理
摘要
洛尔德说话风格的文本语音合成(TTS)系统可提高语音的总体可理解度,适用于听力损失和嘈杂环境。然而,该类模型的训练需要大量数据,而洛尔德效应因说话者和噪声 variability 以及疲劳的录音条件而难以录制。语音转换(VC)已被证明是一种在目标说话者缺乏目标说话风格录音数据时训练TTS系统的有用数据增强技术。本文关注洛尔德说话风格的转换。我们的目标是在保留定义洛尔德说话风格的声学属性的同时进行说话者身份转换。我们比较了带隐式和显式声学特征条件的语音转换模型。我们观察到,我们提出的隐式条件策略在保持说话者相似性的同时,实现的可理解度提升与基于显式声学特征条件的模型相当。
引用
@article{arxiv.2507.09310,
title = {Voice Conversion for Lombard Speaking Style with Implicit and Explicit Acoustic Feature Conditioning},
author = {Dominika Woszczyk and Manuel Sam Ribeiro and Thomas Merritt and Daniel Korzekwa},
journal= {arXiv preprint arXiv:2507.09310},
year = {2025}
}
备注
Presented at Clarity Challenge 2023