中文

学习量化结构保持的运动表示用于舞蹈指纹识别

计算机视觉与模式识别 2026-04-02 v1 人工智能

摘要

我们提出DANCEMATCH,一个用于基于运动的舞蹈检索的端到端框架,该任务定义为舞蹈指纹识别,即直接从原始视频中识别语义相似的编舞。虽然现有的运动分析和检索方法可以比较姿态序列,但它们依赖难以索引、解释或扩展的连续嵌入。相比之下,DANCEMATCH构建紧凑的离散运动特征,捕捉舞蹈的时空结构,同时实现高效的大规模检索。我们的系统将骨架运动量化(SMQ)与时空Transformer(STT)集成,将通过Apple CoMotion提取的人体姿态编码为结构化的运动词汇表。我们进一步设计了舞蹈检索引擎(DRE),它使用基于直方图的索引进行次线性检索,随后通过重排序进行精细匹配。为了促进可复现研究,我们发布了DANCETYPESBENCHMARK,一个以量化运动token标注的姿态对齐数据集。实验表明该方法在多种舞蹈风格下具有鲁棒的检索能力,并对未见编舞具有强泛化性,为可扩展的运动指纹识别和定量编舞分析奠定了基础。

关键词

引用

@article{arxiv.2604.00927,
  title  = {Learning Quantised Structure-Preserving Motion Representations for Dance Fingerprinting},
  author = {Arina Kharlamova and Bowei He and Chen Ma and Xue Liu},
  journal= {arXiv preprint arXiv:2604.00927},
  year   = {2026}
}