中文

MusicJam:通过生成叙事插画可视化音乐洞察

人机交互 2023-08-29 v2

摘要

将无形的音乐之洞察可视化能够为听众带来愉悦且沉浸式的聆听体验,因此在信息可视化领域备受关注。过去几十年间,各种音乐可视化技术相继被提出。然而,其中大多数遵循视觉编码规则手动设计,因而以图形化视觉表征的形式呈现,其视觉编码方案通常难以理解。近年来,一些研究者使用图形或插画来表现音乐情绪、歌词与音乐特征,这种方式更直观且更具吸引力。但这些技术中的图形通常是预先选定或静态生成的,因而无法精确传达不同乐曲的洞察。为解决此问题,本文提出 MusicJam,一个能够生成叙事插画以表征输入音乐洞察的音乐可视化系统。该系统利用基于 GPT-2 设计的新型生成模型,针对输入音乐生成有意义的歌词,随后采用 stable diffusion 模型将歌词转化为连贯的插画。最终,生成结果被同步并渲染为伴随输入音乐的 MP4 视频。我们通过将所提歌词生成模型与基线模型比较来评估该模型,并开展用户研究以评估生成插画及最终音乐视频的质量。结果表明了本技术的有效性。

关键词

引用

@article{arxiv.2308.11329,
  title  = {MusicJam: Visualizing Music Insights via Generated Narrative Illustrations},
  author = {Chuer Chen and Nan Cao and Jiani Hou and Yi Guo and Yulei Zhang and Yang Shi},
  journal= {arXiv preprint arXiv:2308.11329},
  year   = {2023}
}