中文

OmniInsert:基于扩散 Transformer 模型的无掩码视频插入

计算机视觉与模式识别 2025-09-23 v1

摘要

近期基于扩散模型的视频插入技术取得了令人瞩目的进展。然而,现有方法依赖复杂的控制信号,却在主体一致性方面存在困难,限制了实际应用。本文聚焦无掩码视频插入任务,旨在解决数据稀缺、主体-场景平衡及插入和谐问题。为缓解数据稀缺,本文提出新的数据管道 InsertPipe,自动构建多样化的交叉对数据。基于数据管道,我们开发了 OmniInsert——一个用于单参考或多参考主体无掩码视频插入的新型统一框架。具体而言,为维持主体-场景平衡,本文引入简单且有效的 Condition-Specific Feature Injection 机制,以不同方式注入多源条件,并提出新颖的渐进训练策略,使模型能够在主体特征注入与源视频特征注入之间获得平衡。同时,我们设计了 Subject-Focused Loss 以提高主体细节外观。为进一步提升插入和谐性,本文提出 Insertive Preference Optimization 方法,模拟人类偏好进行模型优化;并在参考阶段引入 Context-Aware Rephraser 模块,使主体无缝融入原场景。为解决缺乏基准的问题,本文引入 InsertBench,一个包含多样化场景且精选主体的综合性基准。InsertBench 上的评估表明,OmniInsert 在无掩码视频插入任务中超越了领域内最先进的闭源商业解决方案。代码将公开发布。

关键词

引用

@article{arxiv.2509.17627,
  title  = {OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models},
  author = {Jinshu Chen and Xinghui Li and Xu Bai and Tianxiang Ma and Pengze Zhang and Zhuowei Chen and Gen Li and Lijie Liu and Songtao Zhao and Bingchuan Li and Qian He},
  journal= {arXiv preprint arXiv:2509.17627},
  year   = {2025}
}

备注

Github Page: https://phantom-video.github.io/OmniInsert/