利用跨模态编码旁白的细粒度视频深度音乐检索
信息检索
2021-08-04 v2 多媒体
摘要
近来,不同互联网平台上短视频迅速增长的流行加剧了对背景音乐(BGM)检索系统的需求。然而,现有仅基于视觉模态的视频-音乐检索方法在面对具有细粒度虚拟内容的视频时无法展现出良好性能。本文中,我们还研究了短视频中广泛添加的旁白,并提出一种新颖框架来为细粒度短视频检索BGM。在我们的框架中,我们使用自注意力(SA)和跨模态注意力(CMA)模块分别探索不同模态的内部和相互关系。为平衡模态,我们通过融合门动态分配不同权重给模态特征。为配对查询和BGM嵌入,我们引入三元组伪标签损失来约束模态嵌入的语义。由于目前没有现成的虚拟内容视频-BGM检索数据集,我们构建并发布了两个虚拟内容视频数据集HoK400和CFM400。实验结果表明,我们的方法取得了优越性能,并以较大优势超越其他最先进的方法。
引用
@article{arxiv.2104.10557,
title = {Deep Music Retrieval for Fine-Grained Videos by Exploiting Cross-Modal-Encoded Voice-Overs},
author = {Tingtian Li and Zixun Sun and Haoruo Zhang and Jin Li and Ziming Wu and Hui Zhan and Yipeng Yu and Hengcan Shi},
journal= {arXiv preprint arXiv:2104.10557},
year = {2021}
}
备注
accepted by ACM SIGIR '21