中文

基于光流增强的无训练视频编辑

计算机视觉与模式识别 2026-01-06 v3

摘要

视觉生成的快速发展,特别是预训练文本到图像和文本到视频模型的出现,催化了训练-free 视频编辑研究的日益增长。模仿训练-free 图像编辑技术,当前方法通过视频输入反向编码并在推理过程中操作中间特征和注意力来实现内容编辑。尽管已展示出有前景的结果,但反向编码过程的损失性本质在保持视频未编辑区域方面提出了重大挑战。此外,推理期间的特征和注意力操作可能导致意外的过度编辑,并在局部时间连续性和全局内容一致性方面存在挑战。为解决这些挑战,本研究提出一种基于预训练文本到视频模型的得分蒸馏范式,通过编辑引导的得分蒸馏梯度对原始视频进行迭代优化,以最终获得目标视频。以原始视频为起始点的迭代优化结合内容保持损失,确保了保持原始视频中未编辑区域并抑制了过度编辑。为进一步保证视频内容的一致性和时间连续性,我们额外引入了全局一致性辅助损失和基于光流预测的局部编辑梯度平滑。实验表明,这些策略有效地解决了上述挑战,在多个维度上实现了与最先进方法相当或更好的性能,包括未编辑区域的保持、局部时间连续性和编辑结果的全局内容一致性。

关键词

引用

@article{arxiv.2406.04888,
  title  = {Training-Free Video Editing via Optical Flow-Enhanced Score Distillation},
  author = {Lianghan Zhu and Yanqi Bao and Jing Huo and Jing Wu and Yu-Kun Lai and Wenbin Li and Yang Gao},
  journal= {arXiv preprint arXiv:2406.04888},
  year   = {2026}
}