扩散模型的网络弯曲用于音视频生成
声音
2024-07-01 v1 机器学习
多媒体
音频与语音处理
摘要
本文介绍了创建用于艺术家生成音乐可视化的工具的初步工作,后者利用预训练的生成式机器学习模型。首先,我们研究了网络弯曲——即对生成网络各层内部施加变换——应用于图像生成扩散模型的方法,利用各种点运算、张量运算和形态运算。我们识别出若干视觉效果源于各种运算,包括一些难以通过标准图像编辑工具重现的效果。我们发现,这一过程允许对图像生成进行连续、精细控制,这对创意应用很有帮助。随后,我们通过将音频特征作为参数传递给网络弯曲运算来生成音乐响应视频。最后,我们评论了一些会显著改变图像的变换以及基于这些变换探索稳定扩散潜在空间的可能性。
引用
@article{arxiv.2406.19589,
title = {Network Bending of Diffusion Models for Audio-Visual Generation},
author = {Luke Dzwonczyk and Carmine Emanuele Cella and David Ban},
journal= {arXiv preprint arXiv:2406.19589},
year = {2024}
}
备注
8 pages, 5 figures, to be published in the proceedings of the 27th International Conference on Digital Audio Effects (DAFx24), for additional image and video examples see https://dzluke.github.io/DAFX2024/