中文

基于串联合成与生成式细化的无标注 MIDI 到音频合成

声音 2025-06-12 v2 机器学习 音频与语音处理

摘要

最近的 MIDI 到音频合成方法使用深度神经网络,成功生成了高质量、有表现力的乐器轨道。然而,这些方法需要 MIDI 注释进行监督训练,限制了输出中乐器音色和表达样式的多样性。我们提出了 CoSaRef 方法,不需要 MIDI-音频配对数据集。CoSaRef 首先基于 MIDI 输入使用串联合成生成合成音频轨道,然后通过在无 MIDI 注释数据集上训练的扩散式深度生成模型对其进行细化。这种方法提高了音色和表达样式的多样性。此外,它类似于数字音频工作站 (DAW) 中的传统功能,允许通过音频样本选择和额外 MIDI 设计对音色和表达进行详细控制。实验表明,CoSaRef 能在保持细粒度音色控制的前提下生成逼真的轨道。此外,尽管 CoSaRef 没有在 MIDI 注释上进行监督训练,但在客观和主观评估中,它在基于 MIDI 监督的状态-of-the-art 音色可控方法中取得了优异性能。

关键词

引用

@article{arxiv.2410.16785,
  title  = {Annotation-Free MIDI-to-Audio Synthesis via Concatenative Synthesis and Generative Refinement},
  author = {Osamu Take and Taketo Akama},
  journal= {arXiv preprint arXiv:2410.16785},
  year   = {2025}
}

备注

Work in progress; 7 pages, 4 figures, 3 tables