分割与描述一切
计算机视觉与模式识别
2024-03-27 v2
摘要
我们提出一种方法,高效地为分割一切模型(Segment Anything Model, SAM)赋予生成区域描述(regional captions)的能力。SAM 展现出分割任意物体的强泛化性,但缺乏语义理解。通过引入一个轻量的基于查询的特征混合器,我们将区域特定特征与语言模型的嵌入空间对齐,以用于后续的描述生成。由于可训练参数数量很少(通常在千万量级),该方法计算成本更低、内存占用更少、通信带宽需求更小,从而实现快速且可扩展的训练。为解决区域描述数据稀缺的问题,我们提出首先在目标检测与分割任务上预训练我们的模型。我们将此步骤称为弱监督预训练,因为预训练数据仅包含类别名称而非完整句子描述。弱监督预训练使我们能够利用许多公开可用的目标检测与分割数据集。我们进行了大量实验以证明方法的优越性并验证每个设计选择。本工作可作为扩大区域描述数据规模的垫脚石,并为探索以高效方式增强 SAM 的区域语义提供思路。项目页面及关联代码可通过 https://xk-huang.github.io/segment-caption-anything/ 访问。
引用
@article{arxiv.2312.00869,
title = {Segment and Caption Anything},
author = {Xiaoke Huang and Jianfeng Wang and Yansong Tang and Zheng Zhang and Han Hu and Jiwen Lu and Lijuan Wang and Zicheng Liu},
journal= {arXiv preprint arXiv:2312.00869},
year = {2024}
}
备注
The project page, along with the associated code, can be accessed via https://xk-huang.github.io/segment-caption-anything/; Update author information; Accepted by CVPR 24