AlignSAM: 通过强化学习将分割一切模型与开放上下文对齐
计算机视觉与模式识别
2024-06-04 v1
摘要
在大量精心策划的训练数据的支持下,分割一切模型在提示引导下,在开放世界场景中展示了其令人印象深刻的泛化能力。然而,原始的SAM是类别无关的,并且严重依赖用户提供的提示来分割感兴趣的目标。将这种方法适应于不同任务对于准确识别目标和避免次优分割结果至关重要。在本文中,我们提出了一个名为AlignSAM的新框架,旨在通过强化学习实现自动提示,以将SAM与开放上下文对齐。AlignSAM以智能体为锚点,能够在保持SAM模型参数冻结的同时,使其泛化到各种下游任务。具体来说,AlignSAM启动一个提示智能体,通过与基础模型交互来迭代地优化分割预测。它集成了一个强化学习策略网络,为基础模型提供信息性提示。此外,引入了一个语义重新校准模块,以提供提示的细粒度标签,增强模型处理包含显式和隐式语义任务的能力。在现有基础模型的各种具有挑战性的分割任务上进行的实验证明了所提出的AlignSAM相对于最先进方法的优越性。项目页面:\url{https://github.com/Duojun-Huang/AlignSAM-CVPR2024}。
引用
@article{arxiv.2406.00480,
title = {AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning},
author = {Duojun Huang and Xinyu Xiong and Jie Ma and Jichang Li and Zequn Jie and Lin Ma and Guanbin Li},
journal= {arXiv preprint arXiv:2406.00480},
year = {2024}
}
备注
CVPR2024