中文

钢琴音符的正弦、瞬态与噪声神经建模

声音 2025-02-04 v3 人工智能 音频与语音处理

摘要

本文介绍了一种模拟钢琴声音的新方法。我们提出利用正弦、瞬态和噪声分解来设计一个可微分的频谱建模合成器,以复现钢琴音符。三个子模块从钢琴录音中学习这些成分,并生成相应的谐波、瞬态和噪声信号。将模拟任务分解为三个独立可训练的子模型,降低了建模任务的复杂性。准谐波成分由一个受物理推导公式引导的可微分正弦模型生成,其参数从录音中自动估计。噪声子模块使用一个可学习的时变滤波器,瞬态则由一个深度卷积网络生成。对于单音,我们用一个基于卷积的网络来模拟三弦琴中不同琴键之间的耦合。结果表明,该模型能匹配目标的泛音分布,而预测频谱高频部分的能量则更具挑战性。瞬态和噪声成分频谱中的能量分布总体上是准确的。尽管该模型在计算和内存效率上更具优势,但感知测试显示其在准确建模音符起音阶段方面存在局限性。尽管如此,它在模拟单音和三弦琴方面总体上达到了感知上的准确性。

关键词

引用

@article{arxiv.2409.06513,
  title  = {Sines, Transient, Noise Neural Modeling of Piano Notes},
  author = {Riccardo Simionato and Stefano Fasciani},
  journal= {arXiv preprint arXiv:2409.06513},
  year   = {2025}
}