中文

D^2Conv3D:用于视频中目标分割的动态空洞卷积

计算机视觉与模式识别 2021-11-16 v1

摘要

尽管受到了研究界的显著关注,在单目视频中分割和跟踪目标的任务仍有很大改进空间。已有工作同时证明了空洞卷积和可变形卷积在各种图像级分割任务中的有效性。这让人有理由相信,此类卷积的3D扩展也应能提升视频级分割任务的性能。然而,现有文献尚未对此方面进行充分探索。本文提出动态空洞卷积(D^2Conv3D):一种受空洞卷积与可变形卷积启发并将其扩展到3D(时空)域的新型卷积。我们通过实验表明,仅需将标准卷积直接替换为D^2Conv3D,即可在多个视频分割相关基准上提升多种3D CNN架构的性能。我们进一步表明,D^2Conv3D优于将现有空洞卷积和可变形卷积向3D的平凡扩展。最后,我们在DAVIS 2016无监督视频目标分割基准上取得了新的最先进(state-of-the-art)结果。代码已公开于 https://github.com/Schmiddo/d2conv3d 。

关键词

引用

@article{arxiv.2111.07774,
  title  = {D^2Conv3D: Dynamic Dilated Convolutions for Object Segmentation in Videos},
  author = {Christian Schmidt and Ali Athar and Sabarinath Mahadevan and Bastian Leibe},
  journal= {arXiv preprint arXiv:2111.07774},
  year   = {2021}
}

备注

Accepted to WACV 2022