跨模态音乐-视频推荐:设计选择研究
多媒体
2021-05-03 v1
摘要
本文中,我们研究音乐/视频跨模态推荐,即为视频推荐音轨或反之。我们依托自监督学习范式,从大量无标注数据中学习。更确切地说,我们利用音乐-视频片段中的共现性联合学习音频与视频嵌入。本文建立在近期视频-音乐检索系统(VM-NET)之上,其原本依赖于通过对手工特征计算一组统计量得到的音频表示。我们在此证明,使用音频表示学习(如预训练 MuSimNet、OpenL3、MusicCNN 或 AudioSet 提供的音频嵌入)可大幅改进推荐。我们还验证了 VM-NET 中最初提出的跨模态三元组损失相对于自监督学习中常用的二元交叉熵损失的效用。我们使用 Music Video Dataset (MVD) 进行所有实验。
引用
@article{arxiv.2104.14799,
title = {Cross-Modal Music-Video Recommendation: A Study of Design Choices},
author = {Laure Pretet and Gael Richard and Geoffroy Peeters},
journal= {arXiv preprint arXiv:2104.14799},
year = {2021}
}