中文

CFR-ICL:用于交互式图像分割的级联前向精炼与迭代点击损失

计算机视觉与模式识别 2024-03-06 v2

摘要

基于点击的交互式分割旨在借助用户点击引导从图像中提取感兴趣物体。近期工作通过利用输出的反馈取得了优异的整体性能。然而,在大多数最先进的方法中,1) 推理阶段涉及不灵活的启发式规则且需要独立的精炼模型,2) 用户点击次数与模型性能无法平衡。为应对这些挑战,我们提出了一种基于点击且由掩码引导的交互式图像分割框架,包含三个新颖组件:级联前向精炼(CFR)、迭代点击损失(ICL)和SUEM图像增强。CFR提供统一的推理框架以由粗到精的方式生成分割结果。所提ICL使模型训练在提升分割效果的同时减少用户交互。所提SUEM增强是一种为交互式图像分割创建大规模多样化训练集的综合方法。大量实验证明了所提方法在五个公开数据集上的最先进性能。值得注意的是,在Berkeley和DAVIS数据集上,我们的模型分别将此前最先进方法达到0.95 IoU所需的点击次数减少了33.2%和15.5%。

关键词

引用

@article{arxiv.2303.05620,
  title  = {CFR-ICL: Cascade-Forward Refinement with Iterative Click Loss for Interactive Image Segmentation},
  author = {Shoukun Sun and Min Xian and Fei Xu and Luca Capriotti and Tiankai Yao},
  journal= {arXiv preprint arXiv:2303.05620},
  year   = {2024}
}