LVNS-RAVE:基于RAVE和潜在向量新颖性搜索的多样化音频生成
声音
2024-04-23 v1 机器学习
神经与进化计算
音频与语音处理
摘要
进化算法和生成式深度学习一直是声音生成任务中最强大的两种工具。然而,它们都有局限性:进化算法需要复杂的设计,给控制和实现逼真的声音生成带来挑战。生成式深度学习模型常常从数据集中复制,缺乏创造力。在本文中,我们提出了LVNS-RAVE,一种结合进化算法和生成式深度学习以产生逼真且新颖声音的方法。我们在潜在向量新颖性搜索(LVNS)算法中使用RAVE模型作为声音生成器,VGGish模型作为新颖性评估器。报告的实验表明,该方法能够在使用不同预训练RAVE模型的不同变异设置下成功生成多样化、新颖的音频样本。生成过程的特征可以通过变异参数轻松控制。所提出的算法可以成为声音艺术家和音乐家的创意工具。
引用
@article{arxiv.2404.14063,
title = {LVNS-RAVE: Diversified audio generation with RAVE and Latent Vector Novelty Search},
author = {Jinyue Guo and Anna-Maria Christodoulou and Balint Laczko and Kyrre Glette},
journal= {arXiv preprint arXiv:2404.14063},
year = {2024}
}
备注
Accepted to GECCO 24 Companion