MLV-Edit:面向分钟级视频的一致且高效编辑
计算机视觉与模式识别
2026-03-04 v2
摘要
我们提出了MLV-Edit,一个训练-free、基于流的框架,用于解决分钟级视频编辑的独特挑战。虽然现有技术在短视频操作方面表现出色,但将其扩展到长时段视频仍具有挑战性,因为计算开销昂贵,且在跨越数千帧的情况下难以维持全局时间一致性。为此,MLV-Edit采用分段-分治策略进行分段编辑,由两个核心模块支持:Velocity Blend通过对齐相邻块的流场来纠正段边界上的运动不一致,从而消除常见于碎片化视频处理的闪烁和边界伪影;Attention Sink将局部段特征锚定到全局参考帧,从而有效抑制累积的结构漂移。大量定量和定性实验表明,MLV-Edit在时间稳定性和语义保真度方面 consistently 优于最先进的方法。
引用
@article{arxiv.2602.02123,
title = {MLV-Edit: Towards Consistent and Highly Efficient Editing for Minute-Level Videos},
author = {Yangyi Cao and Yuanhang Li and Lan Chen and Qi Mao},
journal= {arXiv preprint arXiv:2602.02123},
year = {2026}
}