面向感知声音匹配的逆问题求解学习
声音
2024-05-07 v2 音频与语音处理
摘要
感知声音匹配(PSM)旨在寻找合成器的输入参数,以最佳模仿音频目标。用于 PSM 的深度学习优化神经网络来分析与重建预录样本。在此背景下,本文探讨当训练集由可微合成器生成时设计合适损失函数的问题。我们的主要贡献是感知-神经-物理损失(PNP),其旨在权衡感知相关性与计算效率。PNP 背后的关键思想是在每个训练样本附近将合成参数对听觉特征的影响线性化。该线性化过程可大规模并行、可预计算,并在梯度下降期间相比可微数字信号处理(DDSP)提供 100 倍加速。我们在两个非平稳声音数据集上演示 PNP:一个 AM/FM 琶音器与一个矩形膜物理模型。我们表明 PNP 能够在使用联合时频散射变换(JTFS)作为听觉特征时加速 DDSP,同时保持其感知保真度。此外,我们评估了 PSM 中其他设计选择的影响:参数重缩放、预训练、听觉表示与梯度裁剪。我们在两个数据集上均报告了最先进的(SOTA)结果,并发现 PNP 加速的 JTFS 对 PSM 性能的影响大于任何其他设计选择。
引用
@article{arxiv.2311.14213,
title = {Learning to Solve Inverse Problems for Perceptual Sound Matching},
author = {Han Han and Vincent Lostanlen and Mathieu Lagrange},
journal= {arXiv preprint arXiv:2311.14213},
year = {2024}
}