WildActor:无约束身份保持的视频生成
计算机视觉与模式识别
2026-03-10 v2
摘要
生产级人形视频生成要求数字演员在动态镜头、不同视角及复杂动作下保持严格的全身身份一致性,而这一设定对现有方法仍具挑战。先前方法常因面部中心化行为忽视身体层面一致性,或产生人物复制粘贴式瑕疵,导致主体因姿态锁定显得僵硬。我们构建了Actor-18M——一个大规模人形视频数据集,旨�捕捉在无约束视角与环境下的身份一致性。Actor-18M包含160万个视频及其对应的1800万张人物图像,覆盖任意视角及标准三视角表示。基于Actor-18M,我们提出WildActor——一个针对任意视角条件人形视频生成的框架。我们引入非对称身份保持注意力机制,搭配视角自适应蒙特卡洞抽样策略,对参考条件进行迭代重加权,以实现对均衡流形覆盖的边际效用最大化。评估于新构建的Actor-Bench基准上,WildActor在多样化镜头构图、大范围视角转换及显著动作变化的挑战性场景下,始终能够保持身体身份一致性,超越现有方法在这些极端设定下的表现。
引用
@article{arxiv.2603.00586,
title = {WildActor: Unconstrained Identity-Preserving Video Generation},
author = {Qin Guo and Tianyu Yang and Xuanhua He and Fei Shen and Yong Zhang and Zhuoliang Kang and Xiaoming Wei and Dan Xu},
journal= {arXiv preprint arXiv:2603.00586},
year = {2026}
}
备注
Project Page: https://wildactor.github.io/