中文

基于稀疏边界框的视频区域标注

计算机视觉与模式识别 2020-08-18 v1

摘要

视频分析正朝着更细致的解释(如分割)方向发展并取得令人鼓舞的进展。然而,这些任务日益依赖于空间与时间上密集标注的训练数据。由于此类标注劳动密集,带有详细区域边界的密集标注视频数据甚少。本文旨在通过学习从目标区域的稀疏标注边界框自动生成视频所有帧的区域边界来解决这一困境。我们借助体积图卷积网络(VGCN)实现此目标,该网络利用周围表观与运动的时空体迭代地寻找区域边界上的关键点。VGCN 的全局优化使其显著优于现有方案且泛化能力更强。使用两个最新数据集(一个真实、一个合成)的实验结果,包括消融研究,证明了我们方法的有效性与优越性。

关键词

引用

@article{arxiv.2008.07049,
  title  = {Video Region Annotation with Sparse Bounding Boxes},
  author = {Yuzheng Xu and Yang Wu and Nur Sabrina binti Zuraimi and Shohei Nobuhara and Ko Nishino},
  journal= {arXiv preprint arXiv:2008.07049},
  year   = {2020}
}

备注

Accepted for publication in BMVC 2020 (Oral)