VMCML:基于跨模态提升的视频与音乐匹配
计算机视觉与模式识别
2023-03-23 v1
摘要
我们提出了一种基于内容的系统,用于匹配视频与背景音乐。该系统旨在解决为新用户或新音乐搭配短视频时的音乐推荐难题。为此,我们提出了一种跨模态框架 VMCML,以在视频与音乐表征之间寻找共享嵌入空间。为确保两种表征能有效共享该嵌入空间,我们采用了基于间隔余弦相似度损失的 CosFace 损失。此外,我们构建了一个名为 MSVD 的大规模数据集,其中包含 390 首独立音乐及与之对应的 150,000 个匹配视频。我们在 Youtube-8M 和我们的 MSVD 数据集上进行了大量实验。定量与定性结果均证明了我们所提框架的有效性,并取得了最先进的视频与音乐匹配性能。
引用
@article{arxiv.2303.12379,
title = {VMCML: Video and Music Matching via Cross-Modality Lifting},
author = {Yi-Shan Lee and Wei-Cheng Tseng and Fu-En Wang and Min Sun},
journal= {arXiv preprint arXiv:2303.12379},
year = {2023}
}