中文

VidTune:利用生成式音乐和情境缩略图创建视频配乐

人机交互 2026-02-05 v2 多媒体 声音 音频与语音处理

摘要

音乐塑造了视频的基调,但创作者常常难以找到与其视频情绪和叙事相匹配的配乐。近期的文本到音乐模型让创作者能够根据文本提示生成音乐,但我们的形成性研究(N=8)显示,创作者在构建多样化的提示、快速审阅和比较曲目以及理解其对视频的影响方面存在困难。我们推出了 VidTune,这是一个通过从创作者的提示中生成多样化音乐选项并生成情境缩略图以供快速审阅来支持配乐创建的系统。VidTune 提取代表性的视频主体,使缩略图基于情境,将每首曲目的效价和能量映射到颜色和亮度等视觉线索上,并描绘突出的流派和乐器。创作者可以通过自然语言编辑来优化曲目,VidTune 会将其扩展为新的生成结果。在一项受控用户研究(N=12)和一项探索性案例研究(N=6)中,参与者发现 VidTune 有助于高效地审阅和比较音乐选项,并将该过程描述为有趣且富有启发性的。

关键词

引用

@article{arxiv.2601.12180,
  title  = {VidTune: Creating Video Soundtracks with Generative Music and Contextual Thumbnails},
  author = {Mina Huh and C. Ailie Fraser and Dingzeyu Li and Mira Dontcheva and Bryan Wang},
  journal= {arXiv preprint arXiv:2601.12180},
  year   = {2026}
}

备注

Accepted to CHI 2026