FocalClick:迈向实用的交互式图像分割
计算机视觉与模式识别
2022-04-19 v2
摘要
交互式分割允许用户通过正/负点击提取目标掩码。尽管已有许多先前工作探索,学术方法与工业需求之间仍存在差距:首先,现有模型效率不足,无法在低功耗设备上工作;其次,当用于细化已有掩码时表现不佳,因为它们无法避免破坏正确部分。FocalClick 通过预测并更新局部区域的掩码,一次性解决这两个问题。为更高效率,我们将整幅图像上的缓慢预测分解为对小裁剪区域的两个快速推断:在目标裁剪上的粗分割,以及在焦点裁剪上的局部细化。为使模型能处理已有掩码,我们提出一个称为交互式掩码修正的子任务,并给出渐进式合并作为解决方案。渐进式合并利用形态学信息来决定保留何处、更新何处,使用户能有效细化任何已有掩码。FocalClick 以显著更小的 FLOPs 取得了与 SOTA 方法竞争的结果。在已有掩码上做修正时也展现出明显优势。代码与数据将发布于 github.com/XavierCHEN34/ClickSEG。
引用
@article{arxiv.2204.02574,
title = {FocalClick: Towards Practical Interactive Image Segmentation},
author = {Xi Chen and Zhiyan Zhao and Yilei Zhang and Manni Duan and Donglian Qi and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2204.02574},
year = {2022}
}
备注
CVPR2022