中文

UIFormer:用于增量小样本目标检测和实例分割的统一基于 Transformer 的框架

计算机视觉与模式识别 2024-11-14 v1

摘要

本文提出了一种利用 Transformer 架构的统一增量小样本目标检测(iFSOD)和实例分割(iFSIS)的新框架。我们的目标是为仅有少量新目标类别样本、无法获取基础类或旧类训练数据的情况创建最优解,同时在基础类和新类上保持高性能。为实现这一目标,我们将 Mask-DINO 扩展为一个两阶段增量学习框架。第一阶段专注于利用基础数据集优化模型,第二阶段则涉及在新类上微调模型。此外,我们引入了一种分类器选择策略,根据编码器和解码器的不同功能为其分配合适的分类器。实证表明,该方法有效缓解了新类学习中的过拟合问题。此外,我们实施知识蒸馏以防止基础类的灾难性遗忘。在 COCO 和 LVIS 数据集上对 iFSIS 和 iFSOD 任务的全面评估表明,我们的方法显著优于最先进的方法。

关键词

引用

@article{arxiv.2411.08569,
  title  = {UIFormer: A Unified Transformer-based Framework for Incremental Few-Shot Object Detection and Instance Segmentation},
  author = {Chengyuan Zhang and Yilin Zhang and Lei Zhu and Deyin Liu and Lin Wu and Bo Li and Shichao Zhang and Mohammed Bennamoun and Farid Boussaid},
  journal= {arXiv preprint arXiv:2411.08569},
  year   = {2024}
}

备注

11 pages, 3 figures