中文

VioPose:基于层次音视频推断的小提琴演奏4D姿态估计

计算机视觉与模式识别 2024-11-27 v2

摘要

音乐家精细控制身体动作以创造音乐。有时,他们的动作太微妙,肉眼难以捕捉。为了分析他们如何通过运动来演奏音乐,我们需要估计精确的4维人类姿态(3D姿态随时间)。然而,当前最先进(SOTA)的视觉姿态估计算法难以产生准确的单目4D姿态,因为遮挡、局部视角以及人物与物体的相互作用。它们受制于观察角度、像素密度和摄像机采样率,难以估计快速而微妙的动作,如颤音(vibrato)这种音乐效果。在本文中,我们利用音乐产生与创造音乐的人体动作之间的直接因果关系,以解决上述挑战。我们提出VioPose:一种新型多模态网络,层次性地估计动态特征。高层特征级联到低层特征并整合为贝叶斯更新。我们的架构被证明能够产生准确的姿态序列,促进精确的动作分析,并且优于SOTA。作为本工作的一部分,我们收集了最大且最具多样性的已校准小提琴演奏数据集,包括视频、声音和3D动作捕捉姿态。代码和数据集可在我们的项目页面找到 \url{https://sj-yoo.info/viopose/}。

关键词

引用

@article{arxiv.2411.13607,
  title  = {VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference},
  author = {Seong Jong Yoo and Snehesh Shrestha and Irina Muresanu and Cornelia Fermüller},
  journal= {arXiv preprint arXiv:2411.13607},
  year   = {2024}
}

备注

Accepted by WACV 2025 in Round 1. First two authors contributed equally