利用软模内结构约束进行基于内容的视频 - 音乐检索
计算机视觉与模式识别
2017-09-04 v2
摘要
迄今为止,针对为指定视频检索合适音乐或反之的跨模态检索研究有限。此外,现有研究大多依赖于必须单独生成并后期附加的元数据,如关键词、标签或相关描述。本文介绍了一种新的基于内容的视频与音乐跨模态检索方法,该方法通过深度神经网络实现。我们通过模间排序损失训练网络,使得具有相似语义的视频和音乐在嵌入空间中彼此靠近。然而,如果仅使用模间排序约束进行嵌入,可能会丢失模态特有的特征。为解决这一问题,我们提出了一种新颖的软模内结构损失,该损失利用了嵌入前模内样本间的相对距离关系。我们还引入了合理的定量和定性实验方案,以解决视频 - 音乐相关任务尚不成熟、缺乏标准方案的问题。最后,我们构建了一个大规模的 20 万视频 - 音乐对基准数据集。所有数据集和源代码均可在我们的在线仓库中找到 (https://github.com/csehong/VM-NET)。
引用
@article{arxiv.1704.06761,
title = {Content-Based Video-Music Retrieval Using Soft Intra-Modal Structure Constraint},
author = {Sungeun Hong and Woobin Im and Hyun S. Yang},
journal= {arXiv preprint arXiv:1704.06761},
year = {2017}
}
备注
13 pages, 9 figures, 4 tables, supplementary material link >> https://youtu.be/ZyINqDMo3Fg