AdaptiveClick:用于交互式图像分割的点击感知Transformer与自适应焦点损失
计算机视觉与模式识别
2024-03-15 v2 人工智能
图像与视频处理
摘要
交互式图像分割(IIS)已成为减少标注时间的一项有前景的技术。IIS的前后处理已取得实质性进展,但交互歧义这一严重阻碍分割质量的关键问题研究不足。为此,我们引入AdaptiveClick——一种结合自适应焦点损失的点击感知Transformer,通过掩码级与像素级歧义消解工具应对标注不一致。据我们所知,AdaptiveClick是首个基于Transformer、掩码自适应的IIS分割框架。我们方法的核心在于点击感知掩码自适应Transformer解码器(CAMD),其增强了点击与图像特征间的交互。此外,AdaptiveClick可在决策空间中对困难与简单样本实现像素自适应区分,且不受其分布变化影响。这主要通过优化具有理论保证的广义自适应焦点损失(AFL)实现,其中两个自适应系数控制困难与简单像素的梯度值之比。我们的分析表明,常用的Focal与BCE损失可视为所提AFL的特例。借助普通ViT骨干,在九个数据集上的大量实验结果表明,AdaptiveClick优于最先进的方法。源代码公开于 https://github.com/lab206/AdaptiveClick。
引用
@article{arxiv.2305.04276,
title = {AdaptiveClick: Clicks-aware Transformer with Adaptive Focal Loss for Interactive Image Segmentation},
author = {Jiacheng Lin and Jiajun Chen and Kailun Yang and Alina Roitberg and Siyu Li and Zhiyong Li and Shutao Li},
journal= {arXiv preprint arXiv:2305.04276},
year = {2024}
}
备注
Accepted to IEEE Transactions on Neural Networks and Learning Systems (TNNLS). The source code is publicly available at https://github.com/lab206/AdaptiveClick