中文

基于特征最相似传递的高效视频编辑

计算机视觉与模式识别 2025-10-16 v1

摘要

文本到图像(Text-to-Image,T2I)扩散模型最近在视频编辑方面取得了显著进展。然而,现有视频编辑方法严重受限于高计算开销和内存消耗。此外,这些方法常以牺牲视觉保真度为代价,导致不可取的时序不一致和诸如明显的马赛克样模式等视觉瑕疵。我们提出了 Edit-Your-Interest,一种轻量级、文本驱动的零样本视频编辑方法。Edit-Your-Interest 引入时空特征记忆库(Spatio-Temporal Feature Memory,SFM)以缓存前帧的特征,显著降低相较于全序列时空建模方法的计算开销。具体而言,我们首先引入 SFM,其设计用于高效缓存和保留由空间注意力处理的关键图像标记。其次,我们提出了特征最相似传递(Feature Most-Similar Propagation,FMP)方法。FMP 将来自前帧的最相关标记传递到后续帧,保持时序一致性。最后,我们引入 SFM 更新算法,不断刷新缓存的特征,确保其在整个视频序列中长期相关且有效。此外,我们利用跨注意力图自动提取感兴趣实例的掩码。这些掩码无缝集成到扩散去噪过程中,实现对目标对象的精细控制,使 Edit-Your-Interest 能够在稳健保留背景完整性的同时,执行高度精确的编辑。广泛的实验明确表明,所提出的 Edit-Your-Interest 在效率和视觉保真度方面均优于最先进的方法,验证了其卓越的有效性和实用性。

关键词

引用

@article{arxiv.2510.13084,
  title  = {Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation},
  author = {Yi Zuo and Zitao Wang and Lingling Li and Xu Liu and Fang Liu and Licheng Jiao},
  journal= {arXiv preprint arXiv:2510.13084},
  year   = {2025}
}

备注

32 pages, 11 figures