中文

将对象表征重新引入视频对象分割

计算机视觉与模式识别 2024-04-15 v2

摘要

我们提出 Cutie,一种具有对象级记忆读取的视频对象分割(VOS)网络,它将记忆中的对象表征重新放回到视频对象分割结果中。近期 VOS 工作采用自底向上的像素级记忆读取,因匹配噪声而表现不佳,尤其在存在干扰物时,导致在更具挑战性的数据上性能较低。相反,Cutie 通过适配一小簇对象查询来执行自顶向下的对象级记忆读取。借此,它以基于查询的对象 transformer(qt,即 Cutie)与自底向上的像素特征迭代交互。对象查询作为目标对象的高层摘要,同时保留高分辨率特征图以进行精确分割。结合前景-背景掩码注意力,Cutie 清晰地将前景对象的语义与背景分离。在具挑战性的 MOSE 数据集上,Cutie 以相近运行时间较 XMem 提升 8.7 J&F,并较 DeAOT 提升 4.2 J&F 且速度快三倍。代码见:https://hkchengrex.github.io/Cutie

关键词

引用

@article{arxiv.2310.12982,
  title  = {Putting the Object Back into Video Object Segmentation},
  author = {Ho Kei Cheng and Seoung Wug Oh and Brian Price and Joon-Young Lee and Alexander Schwing},
  journal= {arXiv preprint arXiv:2310.12982},
  year   = {2024}
}

备注

CVPR 2024 Highlight. Project page: https://hkchengrex.github.io/Cutie