中文

通过显式-隐式节奏同步学习音乐-舞蹈表征

声音 2023-08-11 v2 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

尽管视听表征已被证明适用于许多下游任务,但舞蹈视频的表征——其更具体且总是伴随着具有复杂听觉内容的音乐——仍然具有挑战性且未被研究。考虑到舞者的节奏运动与音乐节奏之间的内在对齐,我们引入了 MuDaR,一种新颖的音乐-舞蹈表征学习框架,以显式和隐式两种方式执行音乐和舞蹈节奏的同步。具体来说,我们受音乐节奏分析的启发,基于视觉外观和运动线索推导出舞蹈节奏。然后,视觉节奏与由声音强度振幅提取的音乐对应部分在时间上对齐。同时,我们通过对比学习利用音频和视觉流中隐含的节奏一致性。该模型通过预测音频-视觉对之间的时间一致性来学习联合嵌入。音乐-舞蹈表征,连同检测音频和视觉节奏的能力,可以进一步应用于三个下游任务:(a) 舞蹈分类,(b) 音乐-舞蹈检索,和 (c) 音乐-舞蹈重定向。大量实验表明,我们提出的框架大幅优于其他自监督方法。

关键词

引用

@article{arxiv.2207.03190,
  title  = {Learning Music-Dance Representations through Explicit-Implicit Rhythm Synchronization},
  author = {Jiashuo Yu and Junfu Pu and Ying Cheng and Rui Feng and Ying Shan},
  journal= {arXiv preprint arXiv:2207.03190},
  year   = {2023}
}

备注

Accepted for publication in IEEE Transactions on Multimedia