中文

基于交互式时刻潜在空间的音调条件乐器声音合成

声音 2025-10-07 v1 人工智能 机器学习 音频与语音处理 信号处理

摘要

本文提出了一种新颖的神经音乐器声合成方法,采用两种半监督学习框架,能够从富有表现力的时刻潜在空间生成准确的音高且音质卓越的音乐样本。现有的实现音乐制作中足够质量的方法往往依赖于高维潜在表示,这些表示难以导航且提供非直观的用户体验。我们通过两种训练阶段来解决这一限制:首先,我们使用变分自编码器训练一个音高-时刻解耦的二维表示,用于音频样本;其次,我们将这种表示作为条件输入用于 Transformer 基于生成的模型。学习得到的二维潜在空间作为导航和探索声音景观的直观界面。我们证明了该方法有效地学习了时刻空间,使能够以可靠的音高条件下进行富有表现力且可控的音频生成。实验结果表明,该模型能够捕捉到时刻细微变化,同时保持高度的音高准确性。我们在交互式网页应用程序中展示了该方法的可用性,凸显了其作为直观且富有创造力的未来音乐制作环境的潜力:https://pgesam.faresschulz.com

关键词

引用

@article{arxiv.2510.04339,
  title  = {Pitch-Conditioned Instrument Sound Synthesis From an Interactive Timbre Latent Space},
  author = {Christian Limberg and Fares Schulz and Zhe Zhang and Stefan Weinzierl},
  journal= {arXiv preprint arXiv:2510.04339},
  year   = {2025}
}

备注

8 pages, accepted to the Proceedings of the 28-th Int. Conf. on Digital Audio Effects (DAFx25) - demo: https://pgesam.faresschulz.com