统一模型中实现分割与抠图
计算机视觉与模式识别
2026-01-21 v1 人工智能
摘要
分割一切模型(SAM)通过在超过十亿个掩码上训练后展示出的零样本泛化能力和灵活提示,最近推动了分割领域的边界。尽管如此,其掩码预测精度往往达不到实际应用所需的精确度。虽然已提出多种细化模块来提升 SAM 的分割质量,但在单一、统一的框架内实现高度精确的目标轮廓描绘仍然是一个开放的挑战。此外,旨在根据多样化用户提示生成精细 alpha 遮罩的交互式图像抠图,尚未在 SAM 的背景下被探索。近期研究的见解强调了分割与抠图之间的强相关性,表明一个能同时胜任这两项任务的统一模型是可行的。在本文中,我们提出了分割与抠图一切(SAMA),这是 SAM 的一个轻量级扩展,能以极少的额外参数提供高质量的交互式图像分割与抠图。我们的多视角定位编码器(MVLE)从局部视角捕获细节特征,而定位适配器(Local-Adapter)则通过恢复细微的边界细节来细化掩码输出。我们还在架构中为每项任务整合了两个预测头,以同时生成分割和抠图掩码。在由公开来源聚合而成的多样化数据集上训练后,SAMA 在多个分割和抠图基准测试中达到了最先进的性能,展示了其在广泛下游任务中的适应性和有效性。
引用
@article{arxiv.2601.12147,
title = {Segment and Matte Anything in a Unified Model},
author = {Zezhong Fan and Xiaohan Li and Topojoy Biswas and Kaushiki Nag and Kannan Achan},
journal= {arXiv preprint arXiv:2601.12147},
year = {2026}
}
备注
AAAI 2026