中文

基于文本到骨架级联的可控复杂人体动作视频生成

计算机视觉与模式识别 2026-03-10 v1 多媒体

摘要

当前视频扩散模型在生成翻转、卷腰、武术等复杂人体动作视频方面仍面临挑战。文本唯一条件在细粒度动作控制上存在时序歧义,而显式姿态控制虽有效,但需要用户提供完整的骨架序列,对长时段动态动作生产成本高。我们提出一种两阶段级联框架以解决上述问题。首先,自回归文本到骨架模型通过预测每个关节并以已生成的姿态为条件来生成 2D 姿态序列。此设计捕获复杂动作所需的长程时序依赖性和关节间协调。其次,姿态条件下的视频扩散模型以参考图像和生成的骨架序列合成视频。它采用 DINO-ALF(自适应层融合),一种多层参考编码器,在大幅姿态变化和自遮挡情况下保留外观和服装细节。为弥补现有数据集在复杂人体动作视频生成领域的不足,我们引入基于 Blender 的合成数据集,包含 2000 份视频,涵盖多样人物执行杂技和动作戏的动作。该数据集完全可控外观、动作和环境,填补了因现有基准显著低估杂技动作且网页收集数据涉及版权和隐私问题的空白。在该合成数据集和 Motion-X Fitness 基准上实验表明,我们的文本到骨架模型在 FID、R-precision 和动作多样性方面优于先前方法。我们的姿态到视频模型在 VBench 指标中实现最佳成绩,包括时序一致性、动作平滑性和主体保持。

关键词

引用

@article{arxiv.2603.08028,
  title  = {Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades},
  author = {Ashkan Taghipour and Morteza Ghahremani and Zinuo Li and Hamid Laga and Farid Boussaid and Mohammed Bennamoun},
  journal= {arXiv preprint arXiv:2603.08028},
  year   = {2026}
}