OSE:仅选择必需标记以高效处理基于 DiT 的视频对象移除
计算机视觉与模式识别
2026-05-01 v1
摘要
近期基于扩散转换器(DiT)的视频生成技术取得了显著进展,显示出在视频对象移除中展现出惊人的效果。然而,这些方法仍因在整个时空标记空间进行密集计算而面临显著的推理延迟问题。例如,尽管 MiniMax Remover 实现了最前沿的视觉质量,但仅以约 10FPS 的速度运行,主要原因是即使只有小范围的掩码区域实际需要处理,仍对整个时空标记空间进行计算。在本文中,我们提出 YOSE(You Only Select Essential Tokens),一种高效微调框架。YOSE 引入了两个关键组件:Batch Variable-length Indexing(BVI)和扩散过程模拟器(DiffSim)模块。BVI 是一种可微分的动态索引算子,根据掩码信息自适应选择必需标记,实现跨样本的可变长度标记处理。DiffSim 提供一种扩散过程近似机制,用于模拟未掩码区域在 DiT 自注意力中的影响,以保持未掩码标记的语义一致性。通过这些设计,YOSE 实现了掩码感知的加速,其中推理时间大约随掩码区域的大小呈线性增长,而与传统的全标记扩散方法相比,后者的计算量不随掩码大小变化。广泛的实验表明,YOSE 在 70% 的情况下实现了最高可达 2.5 倍的加速,同时保持与基线相当的视觉质量。代码已公开:https://github.com/Wucy0519/YOSE-CVPR26。
引用
@article{arxiv.2604.27322,
title = {YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal},
author = {Chenyang Wu and Lina Lei and Fan Li and Chun-Le Guo and Dehong Kong and Xinran Qin and Zhixin Wang and Ming-Ming Cheng and Chongyi Li},
journal= {arXiv preprint arXiv:2604.27322},
year = {2026}
}
备注
accepted by CVPR2026