BALD-SAM:基于不一致性的交互式分割主动提示
计算机视觉与模式识别
2026-03-12 v1 人工智能
摘要
Segment Anything Model (SAM) 通过空间提示 revolutionized了交互式分割。虽然现有工作主要关注在各种场景下自动化提示,但真实世界的标注工作流程涉及观察模型输出并战略性地放置提示以解决歧义的迭代细化。当前管道通常依赖标注员对预测掩码质量的视觉评估。我们假设,基于模型派生准则识别下一提示最具信息性区域的原则方法是自动化交互式提示的可行途径。本文提出主动提示 (active prompting):一种空间主动学习方法,其中图像中的位置构成未标记的池子,提示作为查询以优先排序信息丰富的区域,从而增加每次交互的效用。我们进一步 presented BALD-SAM:一种将贝叶斯不确定性不一致 (Bayesian Active Learning by Disagreement, BALD) 适用于空间提示选择的原则框架,通过量化认识不确定性来实现。为此,我们冻结整个模型,仅对小型学习预测头应用贝叶斯不确定性建模,将不可行的不确定性估计实际化于大型多百万参数基础模型。跨越自然、医疗、水下和地震等 16 个数据集,BALD-SAM 显示出强大的跨域性能,在 14 个基准中名列前茅或并列第一。我们通过覆盖 3 个 SAM 主干网络和 35 种拉普拉斯后验配置的全面消除实验验证了这些收益,总计 38 种不同的消除设置。除了出色的平均性能外,BALD-SAM 超越了人类提示,在多个类别中甚至超过了 oracle 提示,同时在最终分割质量中持续优于单次基线,尤其在细薄和结构复杂的目标上表现突出。
引用
@article{arxiv.2603.10828,
title = {BALD-SAM: Disagreement-based Active Prompting in Interactive Segmentation},
author = {Prithwijit Chowdhury and Mohit Prabhushankar and Ghassan AlRegib},
journal= {arXiv preprint arXiv:2603.10828},
year = {2026}
}