中文

LIVEditor-14B:基于上下文内稀疏注意力的闪电统一视频编辑

计算机视觉与模式识别 2026-05-29 v2

摘要

视频编辑已向上下文学习 (ICL) 范式演进,然而由此产生的二次注意力开销造成了关键的计算瓶颈。在本工作中,我们提出了上下文内稀疏注意力 (In-context Sparse Attention, ISA),这是首个专为 ICL 视频编辑量身定制的近无损经验稀疏框架。我们的设计基于两个关键洞察:首先,上下文 token 的显著性显著低于源 token;其次,我们在理论上证明并在经验上验证了 Query 锐度与近似误差的相关性。受这些发现的启发,ISA 实现了高效的预选择策略以修剪冗余上下文,随后采用动态 Query 分组机制,将高误差 Query 路由至全注意力,将低误差 Query 路由至计算高效的 0 阶泰勒稀疏注意力。此外,我们基于 ISA 构建了 \textbf{\texttt{LIVEditor-14B}},这是一个新颖的闪电视频编辑模型,并提出了一种视频编辑数据流水线,精心整理了 1.7M 的高质量数据集。大量实验表明,LIVEditor-14B 在将注意力模块延迟降低约 60% 的同时,在 EditVerseBench、IVE-Bench 和 VIE-Bench 上超越了最先进的方法,在不牺牲视觉保真度的前提下实现了近无损加速。

关键词

引用

@article{arxiv.2605.04569,
  title  = {LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention},
  author = {Shitong Shao and Zikai Zhou and Haopeng Li and Yingwei Song and Wenliang Zhong and Lichen Bai and Zeke Xie},
  journal= {arXiv preprint arXiv:2605.04569},
  year   = {2026}
}

备注

Accepted by ICML 2026