少于少样本:自样本视频实例分割
计算机视觉与模式识别
2022-04-20 v1
摘要
本文的目标是在运行时绕过少样本视频理解中对标注样本的需求。尽管已被证明有效,但在许多实际视频场景中,即便标注少量样本似乎也不现实。随着时空视频理解的细致程度及其标注复杂性的持续提升,这一点尤为明显。我们提出自动学习在给定查询时寻找合适支持视频,而非借助人类预言机提供少量密集标注的支持视频来进行少样本学习。我们称之为自样本学习,并概述了一种简单的自监督学习方法,以生成非常适合无监督检索相关样本的嵌入空间。为展示这一新设定,我们首次在自样本(及少样本)设定下处理视频实例分割,其目标是在时空域中以像素级分割实例。我们提供了利用新型基于 transformer 的模型的强基线性能,并表明自样本学习甚至可超越少样本学习,且二者正结合可进一步提升性能。在新基准上的实验表明,我们的方法取得了强劲性能,在某些设定下可与预言机支持相竞争,可扩展至大型无标注视频集合,并可在半监督设定中结合使用。
引用
@article{arxiv.2204.08874,
title = {Less than Few: Self-Shot Video Instance Segmentation},
author = {Pengwan Yang and Yuki M. Asano and Pascal Mettes and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2204.08874},
year = {2022}
}
备注
25 pages, 5 figures, 13 tables