DIFFRENT:一种用于语音录音环境迁移的扩散模型
声音
2024-01-17 v1 音频与语音处理
摘要
正确设置录音条件(包括麦克风类型和位置、房间声学以及环境噪声)对于获得所需的语音声学特征至关重要。在本文中,我们提出了 DiffRENT,一种用于录音环境迁移的扩散模型,它将输入语音转换为具有参考语音的录音条件,同时保留语音内容。我们的模型包括内容增强器、录音环境编码器和扩散解码器,扩散解码器利用增强器和编码器作为输入条件生成目标 mel 频谱图。我们在语音增强和声学匹配场景中评估了 DiffRENT。结果表明,DiffRENT 对未见环境和新说话人具有很好的泛化能力。此外,所提出的模型在客观和主观评估中均取得了优异的性能。我们提出的模型的声音示例可在线获取。
引用
@article{arxiv.2401.08102,
title = {DIFFRENT: A Diffusion Model for Recording Environment Transfer of Speech},
author = {Jaekwon Im and Juhan Nam},
journal= {arXiv preprint arXiv:2401.08102},
year = {2024}
}
备注
4 pages, 2 figures