面向音乐视频领域的对比学习探索
信息检索
2023-09-04 v1 计算机视觉与模式识别
多媒体
声音
音频与语音处理
摘要
对比学习是一种跨多种领域(如图像- caption 检索与音视觉表征学习)学习多模态表征的有力方法。在本工作中,我们研究这些发现是否能推广到音乐视频领域。具体而言,我们为音频与视频模态创建了一个双编码器,并使用双向对比损失对其进行训练。在实验中,我们使用包含 550 000 个音乐视频的工业数据集以及公开的 Million Song Dataset,并在音乐标注与流派分类的下游任务上评估所学表征的质量。我们的结果表明,在两项任务上评估时,未经对比微调的预训练网络优于我们的对比学习方法。为更好地理解对比学习在音乐视频上未奏效的原因,我们对所学表征进行定性分析,揭示了对比学习为何难以统一来自两个模态的嵌入。基于这些发现,我们勾勒出未来工作的可能方向。为促进结果的可复现性,我们共享了代码与预训练模型。
引用
@article{arxiv.2309.00347,
title = {Towards Contrastive Learning in Music Video Domain},
author = {Karel Veldkamp and Mariya Hendriksen and Zoltán Szlávik and Alexander Keijser},
journal= {arXiv preprint arXiv:2309.00347},
year = {2023}
}
备注
6 pages, 2 figures, 2 tables