人工联觉者:基于变分自编码器的图像—旋律互译
计算机视觉与模式识别
2021-12-07 v1 声音
音频与语音处理
摘要
本项目提出一种用于在图像与旋律之间进行翻译的神经网络系统。自编码器将样本中的信息压缩为抽象表示。一个翻译网络通过重复的联合暴露,从音乐与视觉概念中学习一组对应关系。由此产生的“人工联觉者”可生成受图像启发的简单旋律,以及由音乐生成的图像。这些均为新颖的诠释(而非转置数据),表达了机器的感知与理解。观察该作品,人们得以探索机器的感知,并由此反观自身的感知。
引用
@article{arxiv.2112.02953,
title = {The artificial synesthete: Image-melody translations with variational autoencoders},
author = {Karl Wienand and Wolfgang M. Heckl},
journal= {arXiv preprint arXiv:2112.02953},
year = {2021}
}
备注
7 pages, 4 figures, supplementary media can be downloaded at https://doi.org/10.6084/m9.figshare.11394219