歌声中音量水平的分析与变换
音频与语音处理
2023-10-06 v2 声音
摘要
我们引入一种神经自编码器,通过变换音量水平来改变歌声录音中的音乐力度。由于大多数歌声录音未标注音量水平,我们提出一种利用信号音色通过神经音量水平估计器来估算音量水平的方法。我们引入录音因子,将音量水平与录音信号功率以比例常数相关联。这一未知常数取决于录音条件与后处理,因此可能对每次录音不同(但在单次录音内恒定)。我们提供两种无需知晓录音因子即可估算音量水平的方法。未知的录音因子既可与音量水平估计器的权重一同学习,也可基于标量积使用特殊损失函数仅匹配录音信号功率的轮廓。该音量水平模型用于条件化一个先前引入的瓶颈自编码器,其将输入(梅尔谱图)与音量水平解耦。我们在标注了音乐力度的录音上以及通过其向自编码器提供有用信息的能力方面评估了音量水平模型。我们进行了感知测试,评估变换后录音中感知到的音量水平变化与合成质量。感知测试证实,改变条件输入会相应地改变感知到的音量水平,从而表明所提音量水平模型编码了关于真实音量水平的信息。
引用
@article{arxiv.2204.04006,
title = {Analysis and transformations of voice level in singing voice},
author = {Frederik Bous and Axel Roebel},
journal= {arXiv preprint arXiv:2204.04006},
year = {2023}
}
备注
Submitted to ICASSP 2023