基于NaturalSpeech3的自适应远场说话人验证数据增强
声音
2025-01-16 v1 音频与语音处理
摘要
说话人标注的远场语音数据稀缺,成为开发高性能远场说话人验证(SV)系统的显著挑战。虽然使用大规模近场语音数据进行数据增强一直是常见的策略,但近场语音与远场语音之间的声学环境不匹配显著阻碍了远场SV效果的提升。本文提出一种自适应语音增强方法,利用NaturalSpeech3——一个预训练的基础文本到语音(TTS)模型,将近场语音转换为远场语音,通过融合远场声学环境噪声实现数据增强。具体而言,我们利用NaturalSpeech3中的FACodec将语音波形分解为内容子空间、韵律子空间、说话人子空间和残差子空间(声学细节)嵌入,并从这些解缝表示重构语音波形。在本方法中,远场语音的韵律、内容和残差嵌入与来自近场语音的说话人嵌入相组合,以生成保持来自外部领域近场语音说话人身份同时保留内部领域远场语音声学环境的增强伪远场语音。该方法不仅作为增强远场说话人验证训练数据的有效策略,还适用于评估试验中的跨数据增强,用于注册和测试语音。实验结果表明,基于FFSVC的自适应数据增强方法显著优于传统方法(如随机噪声添加和混响)以及其他有竞争力的数据增强策略。
引用
@article{arxiv.2501.08691,
title = {Adaptive Data Augmentation with NaturalSpeech3 for Far-field Speaker Verification},
author = {Li Zhang and Jiyao Liu and Lei Xie},
journal= {arXiv preprint arXiv:2501.08691},
year = {2025}
}