中文

从声音到视觉:迈向 AI 生成的音乐视频

声音 2025-09-03 v1 人工智能 多媒体 音频与语音处理

摘要

传统音乐可视化系统依赖于手工制作的特定形状与颜色转换,表达能力有限。我们提出两种新颖的流程,利用现成的深度学习模型从任意用户指定的声乐或器乐歌曲中自动生成音乐视频。受音乐视频制作人员手工工作流程的启发,我们实验研究了基于潜在特征的技术在多大程度上能够分析音频以检测音乐特质(如情感线索和器乐模式),并利用语言模型将其提炼为文本场景描述。接着,我们采用生成模型来生成相应的视频片段。为了评估生成的视频,我们识别了几个关键方面,并设计实施了一项初步的用户评估,展示了其叙事潜力、视觉连贯性以及与音乐的情感一致性。我们的研究结果强调了潜在特征技术与深度生成模型在超越传统方法扩展音乐可视化方面的潜力。

关键词

引用

@article{arxiv.2509.00029,
  title  = {From Sound to Sight: Towards AI-authored Music Videos},
  author = {Leo Vitasovic and Stella Graßhof and Agnes Mercedes Kloft and Ville V. Lehtola and Martin Cunneen and Justyna Starostka and Glenn McGarry and Kun Li and Sami S. Brandt},
  journal= {arXiv preprint arXiv:2509.00029},
  year   = {2025}
}

备注

1st Workshop on Generative AI for Storytelling (AISTORY), 2025