CONMOD:可控神经帧基调制效果
音频与语音处理
2024-06-21 v1 人工智能
声音
摘要
深度学习模型在建模由 LFO 驱动的音频效果(如相位器和漫移器)方面取得了广泛应用。尽管现有神经网络架构在仿真单个效果方面表现出色,但缺乏通过控制参数来操控输出的能力。为此,我们提出了可控神经帧基调制效果(Controllable Neural Frame-based Modulation Effects, CONMOD),这是一种单一的黑箱模型,能够以帧为单位模拟多种 LFO 驱动的效果,提供对 LFO 频率和反馈参数的控制。此外,该模型能够学习两种不同相位器效果的连续嵌入空间,从而实现效果之间的平滑过渡并生成创造性输出。我们的模型在保持可控性和通用性的同时超越了前期工作,为现代 LFO 驱动音频效果的创意提升开辟了新的可能性。
引用
@article{arxiv.2406.13935,
title = {CONMOD: Controllable Neural Frame-based Modulation Effects},
author = {Gyubin Lee and Hounsu Kim and Junwon Lee and Juhan Nam},
journal= {arXiv preprint arXiv:2406.13935},
year = {2024}
}