面向视频编辑的扩散变换器中的隐式推理
计算机视觉与模式识别
2026-05-26 v1
摘要
指令式视频编辑需要将源视频根据自然语言指令进行转换,同时保持无关内容不变且保持时间一致性。我们认为现有的扩散变换器(DiT)编辑器因两个结构性问题在此任务上难以胜任:其一,条件信号被不加区分地输入到所有变换器块,迫使单一token流同时编码全局编辑意图和细粒度视觉证据;其二,跨注意力模式仅通过像素级重建间接监督,从而导致模型内部推理过程不受约束。为此,我们提出RVEDiT,一个内置于隐式推理视频编辑DiT框架,由两个互补组件构成:第一个是细粒度路由token条件,引入从多模态大语言模型提炼的可学习编辑token,并将其路由到浅层块,同时保留原生视觉和文本token用于深层块,从而在主干网络内部诱导粗到细的编辑过程;第二个是参考锚定注意力对齐,训练期间采用参数共享的参考分支,并最大化编辑分支和参考分支注意力特征之间的互信息,从而在不增加推理成本的情况下正则化模型的内部推理。实验在标准指令式视频编辑基准测试上表明,RVEDiT在各类基线方法上均表现优异,尤其在局部和组合编辑方面取得显著提升。
引用
@article{arxiv.2605.24674,
title = {Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing},
author = {Yan Li and Lin Liu and Xiaopeng Zhang and Qi Tian},
journal= {arXiv preprint arXiv:2605.24674},
year = {2026}
}