中文

NAS-FM:基于调频的可调谐可解释声音合成神经架构搜索

声音 2023-05-23 v1 人工智能 计算与语言 机器学习 多媒体 音频与语音处理

摘要

开发数字声音合成器对音乐产业至关重要,因为它提供了一种低成本的方式来制作具有丰富音色的高质量声音。现有的传统合成器通常需要大量专业知识来确定合成器的整体框架和子模块的参数。由于专家知识难以获取,这阻碍了快速设计和调谐用于多样化声音的数字合成器的灵活性。在本文中,我们提出“NAS-FM”,它采用神经架构搜索(NAS)来构建可微分的调频(FM)合成器。无需任何先验专家知识和人工操作成本,即可从声音中自动开发具有可解释控制的可调谐合成器。具体而言,我们训练一个具有专门设计搜索空间的超网络,包括以不同频率比预测载波与调制器的包络。随后开发了一种具有自适应振荡器大小的进化搜索算法,以寻找振荡器与 FM 频率比之间的最优关系。在不同乐器声音录音上的大量实验表明,我们的算法可以完全自动地构建合成器,取得优于手工合成器的结果。音频样本可在 https://nas-fm.github.io/ 获取。

关键词

引用

@article{arxiv.2305.12868,
  title  = {NAS-FM: Neural Architecture Search for Tunable and Interpretable Sound Synthesis based on Frequency Modulation},
  author = {Zhen Ye and Wei Xue and Xu Tan and Qifeng Liu and Yike Guo},
  journal= {arXiv preprint arXiv:2305.12868},
  year   = {2023}
}