中文

生成式 Disco:用于音乐可视化的文本到视频生成

人机交互 2023-09-29 v2 人工智能

摘要

视觉元素能够增强我们对音乐的体验,因为它们可以放大音乐中所传达的情感与信息。然而,创作音乐可视化是一个复杂、耗时且资源密集的过程。我们介绍了 Generative Disco,一个利用大语言模型与文本到视频生成来帮助生成音乐可视化的生成式 AI 系统。该系统通过寻找用于描述各音乐区间起始与结束画面的提示词,并随音乐节拍在它们之间插值,来帮助用户按区间可视化音乐。我们提出了用于改进这些生成视频的设计模式:转场(transitions),表达颜色、时间、主体或风格上的转换;以及定格(holds),帮助将视频聚焦于主体。一项针对专业人士的研究表明,转场与定格是一个极具表现力的框架,使他们能够构建连贯的视觉叙事。我们最后讨论了这些模式的通用性以及生成视频对创意专业人士的潜力。

关键词

引用

@article{arxiv.2304.08551,
  title  = {Generative Disco: Text-to-Video Generation for Music Visualization},
  author = {Vivian Liu and Tao Long and Nathan Raw and Lydia Chilton},
  journal= {arXiv preprint arXiv:2304.08551},
  year   = {2023}
}