MoBind:面向细粒度 IMU 视频姿态对齐的运动绑定
计算机视觉与模式识别
2026-02-24 v1
摘要
我们旨在学习惯性测量单元(IMU)信号与从视频中提取的 2D 姿态序列之间的联合表示,实现准确的跨模态检索、时间同步、主体和身体部位定位以及动作识别。为此,我们引入 MoBind,一个层次化对比学习框架,旨�解决三个挑战:(1)过滤无关的视觉背景,(2)建模结构化的多传感器 IMU 配置,(3)实现细粒度的亚秒级时间对齐。为隔离与运动相关的线索,MoBind 将 IMU 信号与骨骼运动序列对齐,而非原始像素。我们进一步将全身运动分解为局部身体部位轨迹,每个轨迹与其对应的 IMU 配对,以实现语义导向的多传感器对齐。为捕获详细的时间对应,MoBind 采用层次化对比策略,首先对 token 级时间片段对齐,然后融合局部(身体部位)对齐与全局(全身)运动聚合。评估于 mRi、TotalCapture 和 EgoHumans,MoBind 在所有四个任务上均 consistently 超过强基准,展示了在保持跨模态粗糙语义一致性的同时实现稳健的细粒度时间对齐。代码地址为 https://github.com/bbvisual/ MoBind。
引用
@article{arxiv.2602.19004,
title = {MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignment},
author = {Duc Duy Nguyen and Tat-Jun Chin and Minh Hoai},
journal= {arXiv preprint arXiv:2602.19004},
year = {2026}
}
备注
8 pages, 6 tables, 7 figures, accepted to CVPR26