中文

SqueezeSAM:用户友好的移动端交互式分割

计算机视觉与模式识别 2024-05-22 v3

摘要

Segment Anything Model (SAM) 已成为交互式分割领域的基石,推动了生成式人工智能、计算摄影和医学成像的重大进展。尽管 SAM 能够处理任意用户输入并生成相应的分割掩码,但其基于 ViT-H 的 6 亿参数架构因计算需求高和模型尺寸大,与当前移动硬件不兼容。我们的研究旨在使 SAM 适配移动摄影应用。为此,我们开发了一个全卷积的 SqueezeSAM 模型架构,其速度比原始 SAM 快 62.5 倍,体积小 31.6 倍,使其成为移动应用的可行解决方案。此外,我们的微型模型实现了与原始 VIT-H 架构相差不到 1% 的 mIOU。自动分割在摄影应用的创作流程中具有重要价值,这从其被苹果和剪映等行业领导者采用可见一斑。为了实现这种自动化,我们采用显著对象检测并模拟潜在的用户点击来选择前景对象,生成一个初始分割掩码,用户随后可以交互式地编辑。一个常见的用户期望是,点击对象的特定部分将导致整个对象被分割。例如,点击照片中人物的 T 恤,理想情况下应分割整个人物,而不仅仅是 T 恤。然而,SAM 通常只分割被点击的区域。我们通过一种新颖的数据增强方案解决了这一局限性。因此,如果用户点击一个手持篮球的人,人和篮球都会被一起分割,这符合用户期望并提升了整体用户体验。

关键词

引用

@article{arxiv.2312.06736,
  title  = {SqueezeSAM: User friendly mobile interactive segmentation},
  author = {Balakrishnan Varadarajan and Bilge Soran and Forrest Iandola and Xiaoyu Xiang and Yunyang Xiong and Lemeng Wu and Chenchen Zhu and Raghuraman Krishnamoorthi and Vikas Chandra},
  journal= {arXiv preprint arXiv:2312.06736},
  year   = {2024}
}