视频在音乐中的回响:语义、时间和节奏对齐的视频到音乐生成
声音
2025-12-15 v4 多媒体
摘要
视频到音乐生成旨在生成与视频内容相匹配的背景音乐,以增强视听沉浸感。然而,当前方法存在两个关键局限性:1) 视频细节的表征不完整,导致对齐不足;2) 时间和节奏对应性不足,尤其在实现精确的节拍同步方面。为解决这些挑战,我们提出了 Video Echoed in Music (VeM),一种能够为输入视频生成语义、时间和节奏对齐的高质量音轨的潜在音乐扩散模型。为全面捕获视频细节,VeM 采用层次化视频解析,充当音乐指挥,协调跨模态的多级信息。结合情节引导的跨注意力机制 (SG-CAtt) 的 modality-specific 编码器,将语义线索整合,同时通过位置和持续时间编码保持时间一致性。为实现节奏精度,帧级过渡-节拍对齐器和适配器 (TB-As) 动态地将视觉场景过渡与音乐节拍同步。我们进一步贡献了一个新颖的视频-音乐配对数据集,来源于电子商务广告和视频共享平台,具有更严格的场景过渡-节拍同步要求。同时,我们引入了针对该任务的新型指标。实验结果显示,VeM 在语义相关性和节奏精确性方面显著优于现有方法。
引用
@article{arxiv.2511.09585,
title = {Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation},
author = {Xinyi Tong and Yiran Zhu and Jishang Chen and Chunru Zhan and Tianle Wang and Sirui Zhang and Nian Liu and Tiezheng Ge and Duo Xu and Xin Jin and Feng Yu and Song-Chun Zhu},
journal= {arXiv preprint arXiv:2511.09585},
year = {2025}
}