中文

DI-MaskDINO:联合目标检测与实例分割模型

计算机视觉与模式识别 2024-10-23 v1

摘要

本文由此现象激发而来:在 MaskDINO(即联合检测与分割的 SOTA 模型)的中间变换解码器层开始的中间结果中,目标检测的性能落后于实例分割(即检测-分割性能不平衡)。这一现象启发我们思考:检测-分割不平衡问题是否会限制最终性能的上限?有了这一问题,我们进一步开展了定性和定量的前置实验,这些实验验证了检测-分割不平衡问题对模型性能的负面影响。为解决这一问题,本文提出了 DI-MaskDINO 模型,其核心思念是通过缓解检测-分割不平衡来提高最终性能。DI-MaskDINO 通过配置我们提出的 De-Imbalance(DI)模块和 Balance-Aware Tokens Optimization(BATO)模块来实现,后者用于缓解检测-分割不平衡。DI 模块负责生成平衡感查询(balance-aware query),BATO 模块则利用平衡感查询指导初始特征标记的优化。平衡感查询和优化后的特征标记分别作为变换解码器的查询和键-值,用于联合目标检测和实例分割。实验表明,DI-MaskDINO 在 COCO 和 BDD100K 数据集上优于现有的联合目标检测与实例分割模型,相较于 SOTA 联合检测-分割模型 MaskDINO 获得 +1.2 APboxAP^{box} 和 +0.9 APmaskAP^{mask} 的提升。此外,DI-MaskDINO 相较于 SOTA 目标检测模型 DINO 获得 +1.0 APboxAP^{box} 的提升,相较于 SOTA 分割模型 Mask2Former 获得 +3.0 APmaskAP^{mask} 的提升。

关键词

引用

@article{arxiv.2410.16707,
  title  = {DI-MaskDINO: A Joint Object Detection and Instance Segmentation Model},
  author = {Zhixiong Nan and Xianghong Li and Tao Xiang and Jifeng Dai},
  journal= {arXiv preprint arXiv:2410.16707},
  year   = {2024}
}

备注

16 pages, 3 figures, Conference on Neural Information Processing Systems