V2M-Zero:零配对时间对齐视频到音乐生成
计算机视觉与模式识别
2026-05-15 v2 人工智能
机器学习
多媒体
声音
摘要
现有文本到音乐模型在生成与视频事件在时间上对齐的音乐时存在较大挑战,因为缺乏细粒度的时间控制。我们提出 V2M-ZERO,一种视频到音乐生成方法,能够从视频中生成时间对齐的音乐,实现时间同步与语义控制(如风格、情绪)的 disentanglement,且在训练时无需任何视频-音乐配对数据。我们的 method 灵感来自一个关键观察:时间同步要求匹配变化何时发生以及变化多少,而非关注变化的内容。虽然音乐事件与视觉事件在语义上存在差异,但它们在时间结构上具有共享特征,这些特征可在各模态内独立捕获。我们通过使用预训练的音乐和视频编码器计算的模态内相似性得到事件曲线来捕获这些结构。通过独立测量每个模态内的时间变化,这些曲线提供了跨模态的可比表示。这使得一个简单的训练策略成为可能:在 music-event 曲线上对文本到音乐模型进行微调,然后在推理时替换为 video-event 曲线,无需跨模态训练或配对数据。在 OES-Pub、MovieGenBench-Music 和 AIST++ 数据集上,V2M-ZERO 达到最先进的性能,虽无任何配对 music-video 数据,却在音频质量提升 5-9%、语义对齐提升 13-15%、时间同步提升 21-52%,以及舞蹈视频中节拍对齐提升 28%。我们通过大规模众所争议的听力测试验证了类似结果。我们的结果表明,仅通过模态内特征实现的时间对齐对于视频到音乐生成不仅有效,而且优于配对的跨模态监督。此外,我们的方法实现了对时机和音乐风格(如风格、情绪)的独立控制,实现更可控的生成。
引用
@article{arxiv.2603.11042,
title = {V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation},
author = {Yan-Bo Lin and Jonah Casebeer and Long Mai and Aniruddha Mahapatra and Gedas Bertasius and Nicholas J. Bryan},
journal= {arXiv preprint arXiv:2603.11042},
year = {2026}
}
备注
Project page: https://genjib.github.io/v2m_zero/