Spider:面向上下文依赖概念分割的统一框架
计算机视觉与模式识别
2024-05-29 v2 机器学习
摘要
与人类、汽车和飞机等上下文独立(CI)概念不同,上下文依赖(CD)概念(如伪装物体和医学病灶)要求更高的视觉理解能力。尽管许多 CD 理解任务在各自分支中取得了快速发展,但这种孤立演化导致了其跨域泛化能力受限以及重复的技术创新。由于 CD 任务中前景与背景上下文之间存在强耦合关系,现有方法需要在其专注的领域内训练单独的模型。这限制了它们向通用人工智能(AGI)迈进的现实世界 CD 概念理解。我们提出了一个具有单组参数的统一模型 Spider,只需训练一次。在由图像-掩码组提示驱动的所提概念滤波器的帮助下,Spider 能够理解并区分各种强上下文依赖概念,从而准确捕捉提示者的意图。无需繁杂的技巧,Spider 在 8 个不同的上下文依赖分割任务中显著优于 SOTA 专用模型,包括 4 个自然场景(显著物体、伪装物体、透明物体和阴影)和 4 个医学病灶(COVID-19、息肉、乳腺和皮肤病灶,涵盖彩色结肠镜、CT、超声和皮肤镜模态)。此外,Spider 在持续学习中展现出明显优势。它可以通过微调不到 1% 的参数轻松完成新任务的训练,并且对所有旧任务带来的可容忍性能下降不到 5%。源代码将在 \href{https://github.com/Xiaoqi-Zhao-DLUT/Spider-UniCDSeg}{Spider-UniCDSeg} 公开发布。
引用
@article{arxiv.2405.01002,
title = {Spider: A Unified Framework for Context-dependent Concept Segmentation},
author = {Xiaoqi Zhao and Youwei Pang and Wei Ji and Baicheng Sheng and Jiaming Zuo and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2405.01002},
year = {2024}
}
备注
Accepted by ICML 2024