cMelGAN:一种基于梅尔谱图的高效条件生成模型
声音
2022-05-17 v1 人工智能
机器学习
音频与语音处理
摘要
在机器学习领域分析音乐是一个非常困难的问题,需要考虑众多约束。音频数据具有高维度和结构尺度差异极大的性质,这是其难以建模的主要原因之一。机器学习在音乐中有许多应用,例如对乐曲情绪进行分类、条件音乐生成或流行度预测。本项目的目标是开发一种基于梅尔谱图的流派条件生成音乐模型,并通过将其与现有的使用基于音符表示的生成音乐模型进行比较来评估其性能。我们最初实现了一个称为MelNet的自回归、基于RNN的生成模型。然而,由于其速度慢且输出保真度低,我们决定创建一种基于MelGAN [4] 和条件GAN架构的新的全卷积架构,称为cMelGAN。
引用
@article{arxiv.2205.07319,
title = {cMelGAN: An Efficient Conditional Generative Model Based on Mel Spectrograms},
author = {Tracy Qian and Jackson Kaunismaa and Tony Chung},
journal= {arXiv preprint arXiv:2205.07319},
year = {2022}
}