中文

基于Split-then-Merge的层感视频合成

计算机视觉与模式识别 2025-11-27 v1

摘要

我们提出了Split-then-Merge (StM),一种新颖的框架,用于增强生成视频合成的控制,并解决其数据稀缺问题。与依赖标注数据集或手工规则的常规方法不同,StM 将大量未标记视频分割为动态前景和背景层,然后自主组合它们以学习动态主体如何与多样化场景进行交互。这一过程使模型能够学习实现真实视频生成所需的复杂组合动力学。StM 引入了一种新颖的感知变换训练管道,利用多层融合和增强以实现情境感知合成,同时引入一种保持前景忠实度的损失函数,以在混合过程中维持前景细节。实验表明,StM 在定量基准和基于人类/VLLM的定性评估中均优于 SOTA 方法。更多细节请参阅我们的项目页面:https://split-then-merge.github.io

关键词

引用

@article{arxiv.2511.20809,
  title  = {Layer-Aware Video Composition via Split-then-Merge},
  author = {Ozgur Kara and Yujia Chen and Ming-Hsuan Yang and James M. Rehg and Wen-Sheng Chu and Du Tran},
  journal= {arXiv preprint arXiv:2511.20809},
  year   = {2025}
}

备注

Project Webpage: https://split-then-merge.github.io