模块化交互式视频对象分割:交互到掩码、传播与差异感知融合
计算机视觉与模式识别
2021-03-23 v3
摘要
我们提出模块化交互式 VOS(MiVOS)框架,其解耦了交互到掩码与掩码传播,从而获得更高的泛化性与更优性能。交互模块经独立训练,将用户交互转换为对象掩码,随后由我们的传播模块利用一种新颖的读取时空记忆的 top- 滤波策略进行时间传播。为有效考虑用户意图,提出一种新颖的差异感知模块,学习如何在每次交互前后恰当地融合掩码,这些掩码通过时空记忆与目标帧对齐。我们在 DAVIS 上以不同形式的用户交互(如涂鸦、点击)对方法进行定性与定量评估,表明我们的方法以更少的帧交互优于当前最先进算法,并具有泛化至不同类型用户交互的额外优势。我们贡献了一个大规模合成 VOS 数据集,包含 4.8M 帧的像素级精确分割,并附带源代码以促进未来研究。
引用
@article{arxiv.2103.07941,
title = {Modular Interactive Video Object Segmentation: Interaction-to-Mask, Propagation and Difference-Aware Fusion},
author = {Ho Kei Cheng and Yu-Wing Tai and Chi-Keung Tang},
journal= {arXiv preprint arXiv:2103.07941},
year = {2021}
}
备注
Accepted to CVPR 2021. Project page: https://hkchengrex.github.io/MiVOS/