DiffSound:面向多样推理任务的可微模态声音渲染与逆向渲染
数值分析
2024-09-23 v1 数值分析
偏微分方程分析
摘要
准确估计和模拟来自真实世界声音录音的物体物理属性在视觉、图形和机器人等领域具有重要实际意义。然而,这些方向的进展受限——先前的可微 rigid 或软体模拟技术无法直接应用于模态声合成,因为音频的取样率较高,而之前的音频合成器往往未完全建模发声物体的准确物理属性。我们提出 DiffSound,一种基于隐式形状表示、新的高阶有限元分析模块和可微音频合成器的可微声音渲染框架,用于基于物理的模态声合成。我们的框架由于整个管道的可微性,可以解决广泛的逆问题,包括物理参数估计、几何形状推理和冲击位置预测。实验结果表明我们方法的有效性,突显其能够以基于物理的方式准确再现目标声音的能力。DiffSound 是声合成和分析应用的有价值工具。
引用
@article{arxiv.2409.13485,
title = {Analysis of any order Runge-Kutta Spectral Volume Schemes for 1D Hyperbolic Equations},
author = {Ping Wei and Qing-Song Zou},
journal= {arXiv preprint arXiv:2409.13485},
year = {2024}
}