中文

基于草图的视频对象定位

计算机视觉与模式识别 2023-11-30 v3

摘要

我们提出基于草图的视频对象定位(SVOL),一项新任务,旨在根据输入草图定位视频中的时空对象框。我们首先概述SVOL任务中的挑战,并构建草图-视频注意力网络(SVANet),其设计原则如下:(i)考虑视频的时间信息并弥合草图与视频间的域差距;(ii)准确同时识别并定位多个对象;(iii)处理各种风格的草图;(iv)无分类依赖。具体而言,SVANet配备了一个跨模态Transformer,通过注意力操作对可学习对象令牌、查询草图与视频之间的交互建模,并基于逐帧集合匹配策略学习,该策略在利用全局视频上下文的同时实现帧级预测。我们在一个新整理的SVOL数据集上评估SVANet。依其设计,SVANet成功学习了查询草图与视频对象间的映射,在SVOL基准上取得最先进结果。我们通过大量消融实验与可视化进一步确认SVANet的有效性。最后,我们展示了其在未见数据集与新类别上的迁移能力,表明其在真实应用中的高可扩展性。

关键词

引用

@article{arxiv.2304.00450,
  title  = {Sketch-based Video Object Localization},
  author = {Sangmin Woo and So-Yeong Jeon and Jinyoung Park and Minji Son and Sumin Lee and Changick Kim},
  journal= {arXiv preprint arXiv:2304.00450},
  year   = {2023}
}

备注

WACV 2024; Code: https://github.com/sangminwoo/SVOL