通过显式-隐式节奏同步学习音乐-舞蹈表征
声音
2023-08-11 v2 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
尽管视听表征已被证明适用于许多下游任务,但舞蹈视频的表征——其更具体且总是伴随着具有复杂听觉内容的音乐——仍然具有挑战性且未被研究。考虑到舞者的节奏运动与音乐节奏之间的内在对齐,我们引入了 MuDaR,一种新颖的音乐-舞蹈表征学习框架,以显式和隐式两种方式执行音乐和舞蹈节奏的同步。具体来说,我们受音乐节奏分析的启发,基于视觉外观和运动线索推导出舞蹈节奏。然后,视觉节奏与由声音强度振幅提取的音乐对应部分在时间上对齐。同时,我们通过对比学习利用音频和视觉流中隐含的节奏一致性。该模型通过预测音频-视觉对之间的时间一致性来学习联合嵌入。音乐-舞蹈表征,连同检测音频和视觉节奏的能力,可以进一步应用于三个下游任务:(a) 舞蹈分类,(b) 音乐-舞蹈检索,和 (c) 音乐-舞蹈重定向。大量实验表明,我们提出的框架大幅优于其他自监督方法。
引用
@article{arxiv.2207.03190,
title = {Learning Music-Dance Representations through Explicit-Implicit Rhythm Synchronization},
author = {Jiashuo Yu and Junfu Pu and Ying Cheng and Rui Feng and Ying Shan},
journal= {arXiv preprint arXiv:2207.03190},
year = {2023}
}
备注
Accepted for publication in IEEE Transactions on Multimedia