UniRef++:在时空空间中分割每一个参考对象
计算机视觉与模式识别
2023-12-27 v1
摘要
基于参考的对象分割任务,即指代图像分割 (RIS)、少样本图像分割 (FSS)、指代视频对象分割 (RVOS) 和视频对象分割 (VOS),旨在利用语言或标注掩码作为参考来分割特定对象。尽管各个领域均取得了显著进展,但现有方法通常是针对特定任务设计的,且发展方向各异,这阻碍了这些任务多任务能力的激发。在本工作中,我们结束了当前碎片化的局面,提出了 UniRef++,通过单一架构统一了四种基于参考的对象分割任务。我们方法的核心是提出的 UniFusion 模块,该模块针对不同任务及其指定的参考执行多路融合。随后采用统一的 Transformer 架构以实现实例级分割。凭借统一的设计,UniRef++ 可以在广泛的基准数据集上进行联合训练,并能在运行时通过指定相应的参考灵活地完成多项任务。我们在各种基准数据集上评估了我们的统一模型。大量实验结果表明,我们提出的 UniRef++ 在 RIS 和 RVOS 任务上达到了最先进 (SOTA) 的性能,并在 FSS 和 VOS 任务上凭借参数共享网络表现出了具有竞争力的性能。此外,我们展示了提出的 UniFusion 模块可以轻松集成到当前先进的基础模型 SAM 中,并通过参数高效微调获得令人满意的结果。代码和模型可在 \url{https://github.com/FoundationVision/UniRef} 获取。
引用
@article{arxiv.2312.15715,
title = {UniRef++: Segment Every Reference Object in Spatial and Temporal Spaces},
author = {Jiannan Wu and Yi Jiang and Bin Yan and Huchuan Lu and Zehuan Yuan and Ping Luo},
journal= {arXiv preprint arXiv:2312.15715},
year = {2023}
}
备注
Extended version of ICCV2023 UniRef. 20 pages