论视觉上下文在丰富音乐表示中的作用
声音
2022-10-31 v1 多媒体
音频与语音处理
摘要
人类对音乐的感知与体验高度依赖于上下文。上下文的可变性导致我们在解读和与音乐交互方式上的差异,给设计鲁棒的信息检索模型带来挑战。从多样来源中融入多模态上下文为建模这种可变性提供了有前景的途径。在电影和音乐视频等媒体中呈现的音乐提供了丰富的多模态上下文,调节着底层的人类体验。然而,此类上下文建模探索不足,因为它需要大量多模态数据及相应标注。自监督学习可通过自动提取不同模态间丰富的高层对应关系来帮助应对这些挑战,从而缓解大规模细粒度标注的需求。在本研究中,我们提出 VCMR——视频条件音乐表示,一种从音频及伴随音乐视频中学习音乐表示的对比学习框架。如下游音乐标注任务所评估,上下文视觉信息增强了音乐音频的表示。实验结果表明,所提框架能为音频表示贡献附加的鲁棒性,并指示音乐元素在多大程度上受视觉上下文影响或决定。
引用
@article{arxiv.2210.15828,
title = {On the Role of Visual Context in Enriching Music Representations},
author = {Kleanthis Avramidis and Shanti Stewart and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2210.15828},
year = {2022}
}
备注
5 pages, 4 figures, 1 table