中文

感知-神经-物理声音匹配

声音 2023-03-14 v2 机器学习 音频与语音处理

摘要

声音匹配算法旨在通过参数化音频合成来逼近目标波形。深度神经网络在匹配持续谐波音方面已取得可喜结果。然而,当目标为非平稳且非谐的(如打击乐)时,该任务更具挑战性。我们将此问题归因于损失函数的不足。一方面,参数域中的均方误差(称为“P-loss”)简单快速,但未能兼顾各参数在感知上的不同重要性。另一方面,时频谱域中的均方误差(称为“谱损失”)受感知驱动,并用于可微分数字信号处理(DDSP)。然而,谱损失对音程的预测不佳且其梯度计算代价可能较高,因而收敛缓慢。针对此困境,我们提出感知-神经-物理损失(PNP)。PNP 是谱损失的最优二次逼近,且在训练时与 P-loss 一样快速。我们以物理建模合成作为解码器、联合时频散射变换(JTFS)作为谱表示来实例化 PNP。我们展示了其在与其他损失函数比较下匹配合成鼓声的潜力。

关键词

引用

@article{arxiv.2301.02886,
  title  = {Perceptual-Neural-Physical Sound Matching},
  author = {Han Han and Vincent Lostanlen and Mathieu Lagrange},
  journal= {arXiv preprint arXiv:2301.02886},
  year   = {2023}
}