中文

面向音乐视频领域的对比学习探索

信息检索 2023-09-04 v1 计算机视觉与模式识别 多媒体 声音 音频与语音处理

摘要

对比学习是一种跨多种领域(如图像- caption 检索与音视觉表征学习)学习多模态表征的有力方法。在本工作中,我们研究这些发现是否能推广到音乐视频领域。具体而言,我们为音频与视频模态创建了一个双编码器,并使用双向对比损失对其进行训练。在实验中,我们使用包含 550 000 个音乐视频的工业数据集以及公开的 Million Song Dataset,并在音乐标注与流派分类的下游任务上评估所学表征的质量。我们的结果表明,在两项任务上评估时,未经对比微调的预训练网络优于我们的对比学习方法。为更好地理解对比学习在音乐视频上未奏效的原因,我们对所学表征进行定性分析,揭示了对比学习为何难以统一来自两个模态的嵌入。基于这些发现,我们勾勒出未来工作的可能方向。为促进结果的可复现性,我们共享了代码与预训练模型。

关键词

引用

@article{arxiv.2309.00347,
  title  = {Towards Contrastive Learning in Music Video Domain},
  author = {Karel Veldkamp and Mariya Hendriksen and Zoltán Szlávik and Alexander Keijser},
  journal= {arXiv preprint arXiv:2309.00347},
  year   = {2023}
}

备注

6 pages, 2 figures, 2 tables