中文

基于时间聚合网络与动态模板匹配的快速视频对象分割

计算机视觉与模式识别 2020-07-14 v1

摘要

视频对象分割(VOS)作为视频对象跟踪任务的最精细层级,已取得显著进展。尽管 VOS 任务可自然解耦为图像语义分割与视频对象跟踪,但相较于跟踪,分割方向的研究投入明显更多。本文通过将“检测式跟踪”引入 VOS,提出一种新的时间聚合网络与一种新颖的动态时变模板匹配机制,从而将分割连贯地整合进跟踪中,实现了显著性能提升。值得注意的是,我们的方法完全在线,因此适用于一次性学习,且端到端可训练模型支持单次前向传播中完成多对象分割。我们在 DAVIS 基准上以简洁无冗余的设计在速度与精度上均达到新的 SOTA 性能,速度达每帧 0.14 秒,J&F 指标为 75.9%。

关键词

引用

@article{arxiv.2007.05687,
  title  = {Fast Video Object Segmentation With Temporal Aggregation Network and Dynamic Template Matching},
  author = {Xuhua Huang and Jiarui Xu and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2007.05687},
  year   = {2020}
}

备注

CVPR2020