SEDiT:基于一步扩散 Transformer 的无掩码视频字幕擦除
计算机视觉与模式识别
2026-05-15 v1
摘要
视频扩散模型的最新突破显著加速了视频编辑技术的发展。然而,现有方法通常依赖于基于掩码输入对视频帧进行修复,这需要提前提取目标视频掩码,且分割的精度直接影响补全的质量。在本文中,我们提出了 SEDiT,一种基于一步扩散 Transformer 的新型单阶段视频字幕擦除方法。我们引入了一种无掩码推理方法,能够直接擦除目标字幕。所提出的单阶段框架缓解了以往模型两阶段处理中固有的次优性。由于字幕去除是一项局部编辑任务,大部分像素保持不变,潜在的分布偏移极小,这使其非常适合在校正流下进行一步生成。我们通过实验验证了一步去噪的可靠性,并进一步提供了形式化的理论证明。在字幕去除的局部编辑结构下,条件最优传输 (OT) 映射及其诱导的校正流速度场相对于潜变量是 Lipschitz 连续的,这为一步采样的理论可行性提供了基础。为了解决长期时间一致性的挑战,我们采用了一种混合训练策略,偶尔以干净的首帧潜变量作为模型的条件。这促进了时间连续性,允许推理期间的每个片段利用其前一个片段的输出。为了避免由裁剪和重新插入处理目标而产生的可见接缝,特别是在涉及大幅度运动的场景中,我们将原始视频直接输入 SEDiT。得益于一步和分块的流式推理,我们的方法能够高效处理无限长度的原生 1440p 视频。
关键词
引用
@article{arxiv.2605.14894,
title = {SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer},
author = {Zheng Hui and Yunlong Bai},
journal= {arXiv preprint arXiv:2605.14894},
year = {2026}
}
备注
Project page:http://zheng222.github.io/SEDiT_project