中文

ONE-SHOT:通过空间解耦运动注入和混合上下文集成实现组成性人-环境视频合成

计算机视觉与模式识别 2026-04-02 v1

摘要

最近的视频基础模型(VFM)进展彻底改变了人类导向视频合成,但对主体和场景的细粒度独立编辑仍是关键挑战。最近的尝试通过刚性 3D 几何组成引入更丰富的环境控制,常常在精确控制与生成灵活性之间遭遇尖锐的权衡。此外,重型 3D 预处理仍限制了实际可扩展性。本文提出了 ONE-SHOT,一个用于组成性人-环境视频生成的参数高效框架。我们的关键洞察是将生成过程分解为解耦信号。具体而言,我们引入规范空间注入机制,通过交叉注意力将人类动力学与环境线索解耦。我们还提出了 Dynamic-Grounded-RoPE,一种新型位置嵌入策略,用于在无需任何启发式 3D 对齐的情况下建立不同空间域之间的空间对应关系。为支持长期合成,我们引入混合上下文集成机制,以保持主体和场景在分钟级生成中的一致性。实验表明,我们的方法显著优于最先进的方法,为视频合成提供了卓越的结构控制和创意多样性。我们的项目已在 https://martayang.github.io/ONE-SHOT/ 上线。

关键词

引用

@article{arxiv.2604.01043,
  title  = {ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration},
  author = {Fengyuan Yang and Luying Huang and Jiazhi Guan and Quanwei Yang and Dongwei Pan and Jianglin Fu and Haocheng Feng and Wei He and Kaisiyuan Wang and Hang Zhou and Angela Yao},
  journal= {arXiv preprint arXiv:2604.01043},
  year   = {2026}
}

备注

23 pages, 7 figures