中文

基于端到端对抗训练的时间变系数音频效果建模

声音 2025-12-18 v1 机器学习

摘要

深度学习已成为音频效果建模的标准方法,但严格的黑箱建模在时变系统中仍存在问题。与时不变效果不同,对内部调制通常需要记录或提取控制信号,以确保标准损失函数所需的时间对齐。本文引入基于生成对抗网络(GAN)的框架,使用仅输入-输出音频录音即可建模此类效果,无需提取调制信号。我们提出一种卷积-循环网络架构,通过两阶段策略进行训练:初始的对抗阶段允许模型在无严格相位约束条件下学习调制行为分布,随后进行监督式精调阶段,状态预测网络(SPN)估计所需的初始内部状态,以实现模型与目标的时间同步。此外,本文开发了基于啁铃列车信号的新型目标函数,用于量化调制精度。实验中,我们以复古硬件相位器为例,展示了该方法在完全黑箱环境下捕捉时变动力学的能力。

关键词

引用

@article{arxiv.2512.15313,
  title  = {Time-Varying Audio Effect Modeling by End-to-End Adversarial Training},
  author = {Yann Bourdin and Pierrick Legrand and Fanny Roche},
  journal= {arXiv preprint arXiv:2512.15313},
  year   = {2025}
}

备注

Submitted for review to the Journal of the Audio Engineering Society (JAES). Accompanying website: https://ybourdin.github.io/sptvmod