SAMA:面向指令引导视频编辑的因式化语义锚定与运动对齐
计算机视觉与模式识别
2026-03-20 v1
摘要
当前指令引导视频编辑模型在精确语义修改与忠实运动保持之间难以同时平衡。虽然已有方法依赖注入显式外部先验(如视觉语言模型特征或结构条件)来缓解此问题,但这种依赖严重制约了模型的鲁棒性和泛化能力。为克服这一限制,我们提出SAMA(因式化语义锚定与运动对齐),一个将视频编辑分解为语义锚定和运动建模的框架。首先,我们引入语义锚定,通过在稀疏锚定帧上联合预测语义词和视频潜表示,建立可靠的视觉锚点,实现纯指令感知的结构规划。其次,运动对齐通过在运动导向视频恢复预任务(立方体填充、速度扰动和管道混洗)上预训练同一主干网络,使模型能够直接从原始视频中内化时序动态。SAMA采用两阶段管道进行优化:一个在没有成对视频-指令编辑数据的因式化预训练阶段,学习内在的语义-运动表示;随后在成对编辑数据上进行监督微调。值得注意的是,仅凭因式化预训练即可获得强大的零样本视频编辑能力,验证了该因式化方案的有效性。SAMA在开源模型中实现了最先进的性能,且与领先商业系统(如Kling-Omni)具有竞争力。代码、模型和数据集将公开发布。
引用
@article{arxiv.2603.19228,
title = {SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing},
author = {Xinyao Zhang and Wenkai Dong and Yuxin Song and Bo Fang and Qi Zhang and Jing Wang and Fan Chen and Hui Zhang and Haocheng Feng and Yu Lu and Hang Zhou and Chun Yuan and Jingdong Wang},
journal= {arXiv preprint arXiv:2603.19228},
year = {2026}
}
备注
24 pages, 12 figures