中文

TräumerAI:用StyleGAN梦筑音乐

声音 2021-02-10 v1 机器学习 音频与语音处理

摘要

本文的目标是用神经网络生成响应音乐的视觉吸引人视频,使视频的每一帧反映对应音频片段的音乐特征。为实现该目标,我们提出了一种直接将深度音乐嵌入映射到StyleGAN风格嵌入的神经音乐可视化器,名为TräumerAI,其由使用short-chunk CNN的音乐自动标注模型与在WikiArt数据集上预训练的StyleGAN2组成。我们未建立音乐与视觉语义间的客观度量,而是以主观方式手动标注配对。标注者聆听100段10秒长的音乐片段,并从200个StyleGAN生成的示例中选出适合该音乐的图像。基于收集的数据,我们训练了一个将音频嵌入转换为风格嵌入的简单迁移函数。生成的示例表明,音频与视频间的映射具有一定程度的段内相似性与段间差异性。

关键词

引用

@article{arxiv.2102.04680,
  title  = {Tr\"aumerAI: Dreaming Music with StyleGAN},
  author = {Dasaem Jeong and Seungheon Doh and Taegyun Kwon},
  journal= {arXiv preprint arXiv:2102.04680},
  year   = {2021}
}

备注

presented in NeurIPS Workshop 2020: Machine Learning for Creativity and Design