中文

用于理解舞蹈编排的自动舞蹈视频分割

计算机视觉与模式识别 2024-05-31 v1 人机交互

摘要

将舞蹈视频分割成短动作是理解舞蹈编排的一种流行方式。然而,目前这是手动完成的,需要专家付出大量努力。也就是说,即使社交媒体(如 TikTok 和 YouTube)上有许多舞蹈视频,人们(尤其是新手)仍然难以随意观看短视频片段来练习舞蹈编排。在本文中,我们提出了一种自动将舞蹈视频分割成每个动作的方法。给定一个舞蹈视频作为输入,我们首先提取视觉和音频特征:前者从视频中舞者的关键点计算,后者从视频中音乐的梅尔频谱图计算。接下来,这些特征被传递到时间卷积网络(TCN),并通过选取网络输出的峰值来估计分割点。为了构建我们的训练数据集,我们为 AIST 舞蹈视频数据库中的舞蹈视频标注了分割点,该数据库是一个共享数据库,包含原创街舞视频和版权清晰的舞蹈音乐。评估研究表明,所提出的方法(即结合视觉和音频特征)可以高精度地估计分割点。此外,我们开发了一个应用程序,帮助舞者使用所提出的方法练习舞蹈编排。

关键词

引用

@article{arxiv.2405.19727,
  title  = {Automatic Dance Video Segmentation for Understanding Choreography},
  author = {Koki Endo and Shuhei Tsuchida and Tsukasa Fukusato and Takeo Igarashi},
  journal= {arXiv preprint arXiv:2405.19727},
  year   = {2024}
}

备注

9 pages, 11 figures