Vis2Mus:探索面向可控音乐生成的多模态表征映射
声音
2022-11-11 v1 机器学习
音频与语音处理
摘要
在本研究中,我们探索了从视觉艺术领域到音乐领域的表征映射,借此我们可以将视觉艺术作为控制音乐生成的有效手段。与多模态表征学习中大多数纯数据驱动的研究不同,我们采用了一种分析-综合方法,将深度音乐表征学习与用户研究相结合。这种方法使我们能够在没有大量配对数据的情况下发现可解释的表征映射。具体而言,我们发现视觉到音乐的映射具有类似于等变性的良好性质。换言之,我们可以使用各种图像变换(例如改变亮度、改变对比度、风格迁移)来控制音乐领域中相应的变换。此外,我们发布了 Vis2Mus 系统,作为符号音乐生成的可控接口。
引用
@article{arxiv.2211.05543,
title = {Vis2Mus: Exploring Multimodal Representation Mapping for Controllable Music Generation},
author = {Runbang Zhang and Yixiao Zhang and Kai Shao and Ying Shan and Gus Xia},
journal= {arXiv preprint arXiv:2211.05543},
year = {2022}
}
备注
Submitted to ICASSP 2023. GitHub repo: https://github.com/ldzhangyx/vis2mus