中文

基于选择性状态空间模型对光学压缩器时变响应的建模

声音 2025-01-17 v3 人工智能 音频与语音处理

摘要

本文提出了一种使用深度神经网络和选择性状态空间模型 (Selective State Space) 对光学动态范围压缩器进行建模的方法。该方法超越了基于循环层的先前方法,采用选择性状态空间模块对输入音频进行编码。该方法融合了特征线性调制 (Feature-wise Linear Modulation) 和门控线性单元 (Gated Linear Units) 的 refined 技术,以动态方式调整网络,根据外部参数调整压缩的攻击和释放阶段。该架构适合低延迟和实时应用,至关重要于现场音频处理。该方法在 analog optical compressors TubeTech CL 1B 和 Teletronix LA-2A 上进行了验证,这两种压缩器具有不同的特征。评估采用定量指标和主观听力测试,与其他最先进模型进行比较。结果表明,我们的 black-box 建模方法在所有其他方法中均表现突出,能够准确模拟 seen 和 unseen 训练期间的压缩过程。我们进一步表明,这种准确性与控制参数在数据集中的采样密度之间存在相关性,并识别出攻击快且释放慢的设置是最难以模拟的。

关键词

引用

@article{arxiv.2408.12549,
  title  = {Modeling Time-Variant Responses of Optical Compressors with Selective State Space Models},
  author = {Riccardo Simionato and Stefano Fasciani},
  journal= {arXiv preprint arXiv:2408.12549},
  year   = {2025}
}

备注

Journal of the Audio Engineering Society