中文

模块化交互式视频对象分割:交互到掩码、传播与差异感知融合

计算机视觉与模式识别 2021-03-23 v3

摘要

我们提出模块化交互式 VOS(MiVOS)框架,其解耦了交互到掩码与掩码传播,从而获得更高的泛化性与更优性能。交互模块经独立训练,将用户交互转换为对象掩码,随后由我们的传播模块利用一种新颖的读取时空记忆的 top-kk 滤波策略进行时间传播。为有效考虑用户意图,提出一种新颖的差异感知模块,学习如何在每次交互前后恰当地融合掩码,这些掩码通过时空记忆与目标帧对齐。我们在 DAVIS 上以不同形式的用户交互(如涂鸦、点击)对方法进行定性与定量评估,表明我们的方法以更少的帧交互优于当前最先进算法,并具有泛化至不同类型用户交互的额外优势。我们贡献了一个大规模合成 VOS 数据集,包含 4.8M 帧的像素级精确分割,并附带源代码以促进未来研究。

关键词

引用

@article{arxiv.2103.07941,
  title  = {Modular Interactive Video Object Segmentation: Interaction-to-Mask, Propagation and Difference-Aware Fusion},
  author = {Ho Kei Cheng and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2103.07941},
  year   = {2021}
}

备注

Accepted to CVPR 2021. Project page: https://hkchengrex.github.io/MiVOS/