将视觉艺术转化为音乐
计算机视觉与模式识别
2019-09-15 v1 人机交互
机器学习
声音
音频与语音处理
摘要
本研究提出的联觉变分自编码器(SynVAE)能够在缺乏配对数据集的情况下学习视觉与听觉感官模态之间的一致映射。在 MNIST 以及 Behance Artistic Media 数据集(BAM)上的定量评估表明,SynVAE 能够在保持跨模态潜空间一致性的同时,在转换过程中保留足够的信息内容。在定性评估试验中,人类评估者还能够将音乐样本与其生成所对应的图像进行匹配,准确率最高达 73%。
引用
@article{arxiv.1909.01218,
title = {Translating Visual Art into Music},
author = {Maximilian Müller-Eberstein and Nanne van Noord},
journal= {arXiv preprint arXiv:1909.01218},
year = {2019}
}
备注
Accepted for ICCV 2019 Workshop on Fashion, Art and Design