中文

Video-Robin:面向意图导向的视频到音乐生成的自回归扩散规划

声音 2026-04-24 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

视频到音乐(V2M)是为输入视频创建背景音乐的基本任务。近期的V2M模型通常仅依赖视觉条件实现音视频对齐,且对最终用户提供的语义和风格控制有限。本文提出Video-Robin,一种新颖的文本条件视频到音乐生成模型,实现快速、高质量、语义对齐的音乐生成。为平衡音乐保真度与语义理解,Video-Robin集成自回归规划与扩散合成。具体而言,自回归模块通过语义对齐视觉和文本输入,生成高层次的音乐潜在表示。这些潜在表示随后通过局部扩散Transformer被细化为连贯且高保真的音乐。通过将语义驱动的规划分解为扩散合成,Video-Robin在不牺牲音频真实性的前提下,实现了细粒度的创作者控制。我们的方法在不仅仅接受视频输入的基线以及额外特征条件基线上,在分布内和分布外基准测试中均取得优异性能,推理速度较SOTA提升2.21倍。我们将在论文接受后开源所有代码。

关键词

引用

@article{arxiv.2604.17656,
  title  = {Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation},
  author = {Vaibhavi Lokegaonkar and Aryan Vijay Bhosale and Vishnu Raj and Gouthaman KV and Ramani Duraiswami and Lie Lu and Sreyan Ghosh and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2604.17656},
  year   = {2026}
}