中文

基于姿态迁移的合成人体动作视频数据生成

计算机视觉与模式识别 2025-06-12 v1 人工智能

摘要

在视频理解任务中,特别是涉及人体运动的任务,合成数据生成常常受到不自然特征的困扰,从而降低了其训练效果。诸如手语翻译、手势识别以及自动驾驶中的人体运动理解等任务因此无法充分挖掘合成数据的潜力。本文提出了一种使用姿态迁移(具体而言,可控的 3D 高斯 avatar 模型)生成合成人体动作视频数据的方法。我们在 Toyota Smarthome 和 NTU RGB+D 数据集上评估了该方法,结果表明它提升了动作识别任务的性能。此外,我们证明该方法能够有效扩展小样本数据集,弥补真实训练数据中代表性不足的群体,并增加多样化的背景。我们将该方法与 RANDOM People 数据集一同开源,RANDOM People 是一个通过互联网众包收集的、包含新颖人体身份视频和 avatar 的数据集。

关键词

引用

@article{arxiv.2506.09411,
  title  = {Synthetic Human Action Video Data Generation with Pose Transfer},
  author = {Vaclav Knapp and Matyas Bohacek},
  journal= {arXiv preprint arXiv:2506.09411},
  year   = {2025}
}