基于简化框架的可扩展视频对象分割
计算机视觉与模式识别
2023-08-22 v1
摘要
当前主流的视频对象分割(VOS)方法通过若干手工设计的模块实现特征匹配,这些模块分别执行特征提取与匹配。然而,上述手工设计经验性地导致目标交互不足,从而限制了VOS中动态目标感知特征的学习。为应对这些局限,本文提出一种可扩展的简化VOS(SimVOS)框架,利用单一transformer骨干网络进行联合特征提取与匹配。具体而言,SimVOS采用可扩展的ViT骨干网络,对查询特征与参考特征同时执行特征提取与匹配。该设计使SimVOS能够学习更好的目标感知特征以进行精确掩码预测。更重要的是,SimVOS可直接将预训练良好的ViT骨干网络(如MAE)应用于VOS,从而弥合了VOS与大规模自监督预训练之间的鸿沟。为获得更优的性能-速度权衡,我们进一步探索帧内注意力并提出一种新的令牌精炼模块以提高运行速度并节省计算开销。实验上,我们的SimVOS在主流视频对象分割基准DAVIS-2017(88.0% J&F)、DAVIS-2016(92.9% J&F)和YouTube-VOS 2019(84.2% J&F)上取得了最先进结果,且未使用以往VOS方法中采用的任何合成视频或BL30K预训练。
引用
@article{arxiv.2308.09903,
title = {Scalable Video Object Segmentation with Simplified Framework},
author = {Qiangqiang Wu and Tianyu Yang and Wei WU and Antoni Chan},
journal= {arXiv preprint arXiv:2308.09903},
year = {2023}
}
备注
ICCV-2023