中文

轻量化适配器与时序感知逆转提升低成本视频编辑

计算机视觉与模式识别 2025-06-12 v4

摘要

最近的文本到图像(text-to-image, T2I)生成技术通过扩散模型取得了显著进展,使能够利用预训练模型实现成本效益的视频编辑应用,无需资源密集型训练。然而,T2I生成的帧独立性往往导致时序一致性差。现有方法通过时序层微调或基于推断的时序传播来解决此问题,但这些方法要么训练成本高,要么时序连贯性有限。为此,我们提出一种通用高效适配器(GE-Adapter),集成时序-空间一致性与Bilateral DDIM逆转。该框架引入三个关键组件:(1)基于帧的时序一致性模块(FTC Blocks),通过时序感知损失函数捕获帧特定特征并实现平滑的帧间转换;(2)通道依赖的空间一致性模块(SCD Blocks),采用双边滤波器增强空间连贯性,降低噪声和伪影;(3)基于标记的语义一致性模块(TSC Module),通过共享提示标记和帧特定标记维持语义对齐。我们的方法在感知质量、文本-图像对齐和时序一致性方面显著提升,实验在MSR-VTT数据集上证明。此外,它实现了增强的保真度和帧间连贯性,为T2V编辑提供了实用解决方案。

关键词

引用

@article{arxiv.2501.04606,
  title  = {Enhancing Low-Cost Video Editing with Lightweight Adaptors and Temporal-Aware Inversion},
  author = {Yangfan He and Sida Li and Jianhui Wang and Kun Li and Xinyuan Song and Xinhang Yuan and Keqin Li and Kuan Lu and Menghao Huo and Jingqun Tang and Yi Xin and Jiaqi Chen and Miao Zhang and Xueqian Wang},
  journal= {arXiv preprint arXiv:2501.04606},
  year   = {2025}
}