中文

STR-Match:面向免训练视频编辑的时空相关性分数匹配

计算机视觉与模式识别 2025-07-01 v1 人工智能

摘要

以往的文本引导视频编辑方法常存在时间不一致、运动失真以及——最显著地——领域变换受限的问题。我们将这些局限性归因于编辑过程中对时空像素相关性建模不足。为解决此问题,我们提出了 STR-Match,一种免训练视频编辑算法,通过我们新颖的 STR 分数引导的隐空间优化,生成视觉上吸引人且时空连贯的视频。该分数利用文本到视频(T2V)扩散模型中的 2D 空间注意力和 1D 时间模块来捕获相邻帧间的时空像素相关性,而无需计算开销高昂的 3D 注意力机制。结合隐空间掩码融入隐空间优化框架后,STR-Match 生成了时间一致且视觉忠实的视频,即使在显著领域变换下也能保持强性能,同时保留源视频的关键视觉属性。大量实验表明,STR-Match 在视觉质量和时空一致性上均持续优于现有方法。

关键词

引用

@article{arxiv.2506.22868,
  title  = {STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing},
  author = {Junsung Lee and Junoh Kang and Bohyung Han},
  journal= {arXiv preprint arXiv:2506.22868},
  year   = {2025}
}

备注

15 pages, 9 figures, 3 tables