基于遗传算法的音频引导专辑封面艺术生成
声音
2022-07-18 v1 图形学
机器学习
多媒体
神经与进化计算
音频与语音处理
摘要
Spotify 上每天发布超过 60,000 首歌曲,对听众注意力的竞争极为激烈。在这方面,引人入胜且具吸引力的封面艺术的重要性不容低估,因为它与歌曲的特质和艺人的身份深度交织,并且仍是引导人们发现音乐最重要的门户之一。然而,设计封面艺术是一个极具创造性、耗时且有时昂贵的过程,可能令人望而生畏,尤其对非正式艺人而言。为此,我们提出了一种由音频特征引导生成封面艺术的新颖深度学习框架。受 VQGAN-CLIP 启发,我们的方法具有高度灵活性,因为各组件可轻松替换而无需任何重新训练。本文概述了我们模型的架构细节,并讨论了由此产生的优化挑战。更具体地,我们将利用遗传算法来克服不良的局部极小和对抗样本。我们发现,我们的框架能为大多数流派生成合适的封面艺术,且视觉特征能随音频特征变化而自适应调整。鉴于这些结果,我们相信我们的框架为音频引导视觉生成任务中的扩展与更先进应用铺平了道路。
引用
@article{arxiv.2207.07162,
title = {Audio-guided Album Cover Art Generation with Genetic Algorithms},
author = {James Marien and Sam Leroux and Bart Dhoedt and Cedric De Boom},
journal= {arXiv preprint arXiv:2207.07162},
year = {2022}
}
备注
8 pages, 6 figures, 4 tables