中文

城市声传播:用于复杂物理系统的单步生成模型基准

声音 2024-03-20 v2 计算机视觉与模式识别 音频与语音处理

摘要

数据驱动的复杂物理系统建模正获得越来越多的关注,涵盖模拟和机器学习社区。由于大多数物理仿真基于计算密集的、离散求解微分方程的迭代实现,替换为学习的单步推理模型有望在广泛应用领域实现显著加速。在此背景下,我们提出了一个用于评估单步生成学习模型在速度和物理正确性方面的新基准。我们的城市声传播基准基于物理复杂且在实际中具有重要意义,却直观易于理解的任务:建模声源在城市环境中二维波的传播。我们提供的数据集包含10万个样本,每个样本由来自OpenStreetmap的真实二维建筑图、参数化声源以及给定场景的仿真基准声传播组成。数据集提供四种不同仿真任务,涉及反射、衍射和源方差的复杂度递增。对常见生成U-Net、GAN和扩散模型进行首次基准评估显示,虽然这些模型在简单情况下非常擅长建模声传播,但对由更高阶方程表示的子系统的近似系统性失败。关于数据集的信息、下载说明和源代码均提供于我们的网站:https://www.urban-sound-data.org。

关键词

引用

@article{arxiv.2403.10904,
  title  = {Urban Sound Propagation: a Benchmark for 1-Step Generative Modeling of Complex Physical Systems},
  author = {Martin Spitznagel and Janis Keuper},
  journal= {arXiv preprint arXiv:2403.10904},
  year   = {2024}
}