MotionBeat:通过具身对比学习和条形等变接触感知编码实现运动对齐的音乐表示
声音
2026-01-30 v2 人工智能
多媒体
摘要
音乐既是听觉现象也是具身现象,与人类运动紧密相关,自然通过舞蹈表达。然而,大多数现有音频表示忽略了这一具身维度,限制了其捕捉驱动运动的节奏和结构线索的能力。我们提出 MotionBeat,一个面向运动对齐音乐表示学习的框架。MotionBeat 通过两种新提出的目标函数进行训练:具身对比损失 (Embodied Contrastive Loss, ECL),是一种增强的 InfoNCE 公式,包含节拍感知和节拍抖动负样本,以实现细粒度的节奏判别;以及结构节奏对齐损失 (Structural Rhythm Alignment Loss, SRAL),确保节奏一致性,通过对齐音乐重音与相应运动事件。从架构上看,MotionBeat 引入条形等变相位旋转以捕捉循环节奏模式,并引入接触导向注意力以强调与音乐重音同步的运动事件。实验表明,MotionBeat 在音乐到舞蹈生成等 state-of-the-art 音频编码器方面表现优异,并能有效迁移至节拍跟踪、音乐标记、曲目与乐器分类、情感识别以及音视频检索。我们的项目演示页面:https://motionbeat2025.github.io/。
引用
@article{arxiv.2510.13244,
title = {MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding},
author = {Xuanchen Wang and Heng Wang and Weidong Cai},
journal= {arXiv preprint arXiv:2510.13244},
year = {2026}
}
备注
5 pages, 1 figure, accepted by ICASSP 2026. demo page: https://motionbeat2025.github.io/