DI-MaskDINO:联合目标检测与实例分割模型
计算机视觉与模式识别
2024-10-23 v1
摘要
本文由此现象激发而来:在 MaskDINO(即联合检测与分割的 SOTA 模型)的中间变换解码器层开始的中间结果中,目标检测的性能落后于实例分割(即检测-分割性能不平衡)。这一现象启发我们思考:检测-分割不平衡问题是否会限制最终性能的上限?有了这一问题,我们进一步开展了定性和定量的前置实验,这些实验验证了检测-分割不平衡问题对模型性能的负面影响。为解决这一问题,本文提出了 DI-MaskDINO 模型,其核心思念是通过缓解检测-分割不平衡来提高最终性能。DI-MaskDINO 通过配置我们提出的 De-Imbalance(DI)模块和 Balance-Aware Tokens Optimization(BATO)模块来实现,后者用于缓解检测-分割不平衡。DI 模块负责生成平衡感查询(balance-aware query),BATO 模块则利用平衡感查询指导初始特征标记的优化。平衡感查询和优化后的特征标记分别作为变换解码器的查询和键-值,用于联合目标检测和实例分割。实验表明,DI-MaskDINO 在 COCO 和 BDD100K 数据集上优于现有的联合目标检测与实例分割模型,相较于 SOTA 联合检测-分割模型 MaskDINO 获得 +1.2 和 +0.9 的提升。此外,DI-MaskDINO 相较于 SOTA 目标检测模型 DINO 获得 +1.0 的提升,相较于 SOTA 分割模型 Mask2Former 获得 +3.0 的提升。
引用
@article{arxiv.2410.16707,
title = {DI-MaskDINO: A Joint Object Detection and Instance Segmentation Model},
author = {Zhixiong Nan and Xianghong Li and Tao Xiang and Jifeng Dai},
journal= {arXiv preprint arXiv:2410.16707},
year = {2024}
}
备注
16 pages, 3 figures, Conference on Neural Information Processing Systems