多类多实例分割的Segment Any Object Model(SAOM):实到模拟细调策略
计算机视觉与模式识别
2024-03-19 v1 人工智能
摘要
多类多实例分割是识别图像中多个对象类别以及同一类别多个实例的掩码的任务。Segment Anything Model(SAM)是为可提示的多类多实例分割设计的,但在各种实际应用中, tends to output part or sub-part masks in the "everything" mode。整体对象分割掩码在室内场景理解中起着关键作用,尤其是在机器人应用中。我们提出了一种新的领域不变的实到模拟(Real-Sim)细调策略,用于SAM。我们使用来自Ai2Thor模拟器期间收集的对象图像和ground truth数据进行细调(实到模拟)。为使SAOM能够在"everything"模式下工作,我们提出了一种新颖的最近邻分配方法,更新每个ground truth掩码的点嵌入。我们在自身收集的来自Ai2Thor模拟器的数据集上评估了SAOM。SAOM在54个常见室内物体类别上的mIoU提高了28%,mAcc提高了25%。此外,我们的实到模拟细调策略在未训练真实环境数据的情况下,展示了在真实环境中的有前景的泛化性能。该数据集和代码将在发布后公开。
引用
@article{arxiv.2403.10780,
title = {Segment Any Object Model (SAOM): Real-to-Simulation Fine-Tuning Strategy for Multi-Class Multi-Instance Segmentation},
author = {Mariia Khan and Yue Qiu and Yuren Cong and Jumana Abu-Khalaf and David Suter and Bodo Rosenhahn},
journal= {arXiv preprint arXiv:2403.10780},
year = {2024}
}