中文

PoseAnything:基于部件感知时序一致性的通用姿态引导视频生成

计算机视觉与模式识别 2025-12-16 v1

摘要

姿态引导视频生成指通过姿态序列控制生成视频中主体的运动,从而实现对主体运动的精确控制,具有重要的动画应用前景。然而,现有姿态引导视频生成方法仅能接受人类姿态作为输入,泛化性差。为此,我们提出 PoseAnything,即首个能够处理人类和非人类角色姿态的通用姿态引导视频生成框架,支持任意骨架输入。为增强运动期间的一致性,我们引入部件感知时序一致性模块,将主体划分为不同部件,建立部件对应关系,并计算跨帧对应部件之间的注意力,以实现细粒度的部件级一致性。此外,我们提出主体与相机运动解耦 CFG 作为新的指导策略,首次实现姿态引导视频生成中独立的相机运动控制,通过分别将主体和相机运动控制信息注入 CFG 的正负锚点。我们还 presented XPose 数据集,包含 50,000 对非人类姿态-视频对,并提供自动化的标注与过滤流程。大量实验表明,PoseAnything 在有效性和泛化性方面均显著优于当前最先进的方法。

关键词

引用

@article{arxiv.2512.13465,
  title  = {PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence},
  author = {Ruiyan Wang and Teng Hu and Kaihui Huang and Zihan Su and Ran Yi and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2512.13465},
  year   = {2025}
}