中文

DreamVideo-Omni:基于潜在身份强化学习的全方位运动控制多主体视频定制

计算机视觉与模式识别 2026-03-13 v1

摘要

虽然大规模扩散模型已彻底改变了视频合成,但实现对多主体身份和多粒度运动的精确控制仍是显著挑战。最近的尝试常常因运动粒度受限、控制模糊和身份退化而在身份保持和运动控制性能上表现不佳。在本工作中,我们提出DreamVideo-Omni,一个统一框架,实现通过渐进式双阶段训练的多主体定制化,实现全方位运动控制。在第一阶段,我们集成了全面的控制信号进行联合训练,包括主体外观、全局运动、局部动态和摄像机运动。为确保稳健且精确的可控性,我们引入条件感知3D旋转位置编码以协调异构输入,并采用层次化运动注入策略以增强全局运动指导。此外,为解决多主体模糊问题,我们引入组别和角色嵌入,以明确将运动信号锚定到特定身份,从而有效地将复杂场景解耦为独立的可控实例。在第二阶段,为缓解身份退化,我们设计了潜在身份奖励反馈学习范式,通过在预训练的视频扩散主干网络上训练潜在身份奖励模型。这在潜在空间中提供运动感知的身份奖励,优先考虑与人类偏好相符的身份保持。在我们精选的大规模数据集和DreamOmni Bench全面评估多主体和全方位运动控制的支持下,DreamVideo-Omni在生成高质量视频方面表现出色,实现了精确的可控性。

关键词

引用

@article{arxiv.2603.12257,
  title  = {DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning},
  author = {Yujie Wei and Xinyu Liu and Shiwei Zhang and Hangjie Yuan and Jinbo Xing and Zhekai Chen and Xiang Wang and Haonan Qiu and Rui Zhao and Yutong Feng and Ruihang Chu and Yingya Zhang and Yike Guo and Xihui Liu and Hongming Shan},
  journal= {arXiv preprint arXiv:2603.12257},
  year   = {2026}
}

备注

Project Page: https://dreamvideo-omni.github.io