SimInsert:基于区域稀疏注意力融合的无感视频物体插入
计算机视觉与模式识别
2026-05-25 v1 人工智能
摘要
视频物体插入要求确保时空一致性和交互式真实感,这远远超出简单的内容放置。然而,当前方法往往受制于依赖显式运动工程或资源密集型重新训练,限制了其灵活性和泛化能力。为弥合这一差距,我们提出了\textit{SimInsert},一种训练无关的范式,高效地将任务解耦为直观的单帧编辑和语义运动描述。通过利用图像到视频扩散模型的强大生成先验,SimInsert 在时序上传递编辑,严格保持背景不变,同时实现对插入物体与动态环境之间可靠、文本驱动的交互。我们的方法依赖于非侵入式引导机制,以确保结构一致性、实现无缝边界融合,并抵消通常在去噪轨迹期间积累的 fidelity 漂移。广泛的定量实验验证了我们的有效性:SimInsert 在 PSNR 上超越最新方法提升 18.8%,在 SSIM上提升 20.1%,在 LPIPS 上降低 44.1%,为高保真视频编辑提供了简洁解决方案。
引用
@article{arxiv.2605.23245,
title = {SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion},
author = {Xinyu Chen and Yuyi Qian and Jiang Lin and Shenyi Wang and Gao Wang and Zhiqiu Zhang and Jizhi Zhang and Mingjie Wang and Qiang Tang and Qian Wang and Song Wu and Zili Yi},
journal= {arXiv preprint arXiv:2605.23245},
year = {2026}
}
备注
Accepted by ICME2026