中文

WildActor:无约束身份保持的视频生成

计算机视觉与模式识别 2026-03-10 v2

摘要

生产级人形视频生成要求数字演员在动态镜头、不同视角及复杂动作下保持严格的全身身份一致性,而这一设定对现有方法仍具挑战。先前方法常因面部中心化行为忽视身体层面一致性,或产生人物复制粘贴式瑕疵,导致主体因姿态锁定显得僵硬。我们构建了Actor-18M——一个大规模人形视频数据集,旨�捕捉在无约束视角与环境下的身份一致性。Actor-18M包含160万个视频及其对应的1800万张人物图像,覆盖任意视角及标准三视角表示。基于Actor-18M,我们提出WildActor——一个针对任意视角条件人形视频生成的框架。我们引入非对称身份保持注意力机制,搭配视角自适应蒙特卡洞抽样策略,对参考条件进行迭代重加权,以实现对均衡流形覆盖的边际效用最大化。评估于新构建的Actor-Bench基准上,WildActor在多样化镜头构图、大范围视角转换及显著动作变化的挑战性场景下,始终能够保持身体身份一致性,超越现有方法在这些极端设定下的表现。

关键词

引用

@article{arxiv.2603.00586,
  title  = {WildActor: Unconstrained Identity-Preserving Video Generation},
  author = {Qin Guo and Tianyu Yang and Xuanhua He and Fei Shen and Yong Zhang and Zhuoliang Kang and Xiaoming Wei and Dan Xu},
  journal= {arXiv preprint arXiv:2603.00586},
  year   = {2026}
}

备注

Project Page: https://wildactor.github.io/