中文

FocalClick-XL: 面向统一且高质量交互式分割的方法

计算机视觉与模式识别 2025-06-18 v1

摘要

交互式分割通过简单的交互(如点击、笔画和框选)使用户能够提取目标对象的二值掩码。然而,现有方法往往仅支持有限的交互形式,且难以捕捉细节。本文我们重新审视FocalClick的经典粗到细设计,提出显著扩展。在灵感来自其多阶段策略的基础上,我们提出一种新颖管线FocalClick-XL,以同时解决上述挑战。遵循大规模预训练的最新趋势,我们将交互式分割分解为捕获不同信息层级的元任务——上下文、对象和细节,为每个层级分配专门的子网络。这一分解允许每个子网络使用独立数据和监督进行规模化预训练,以最大化其效能。为增强灵活性,我们在不同交互形式之间共享上下文和细节层面的信息作为通用知识,同时在对象层级引入提示层以编码特定的交互类型。结果显示,FocalClick-XL在基于点击的基准测试中实现了最先进的性能,并在包括框选、笔画和粗糙掩码在内的多种交互格式中展现出显著的适应性。除了生成二值掩码外,它还能够预测具有细粒度细节的Alpha Matte,使其成为交互式分割的通用且强大的工具。

关键词

引用

@article{arxiv.2506.14686,
  title  = {FocalClick-XL: Towards Unified and High-quality Interactive Segmentation},
  author = {Xi Chen and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2506.14686},
  year   = {2025}
}