中文

无训练的实例分割数据集修剪

计算机视觉与模式识别 2025-03-04 v1 机器学习

摘要

现有数据集修剪技术主要聚焦于分类任务,限制了其在实例分割等更复杂且实用的任务中的适用性。实例分割提出了三个关键挑战:像素级标注、实例面积变化以及类别不平衡,这些因素显著复杂化了数据集修剪工作。直接采用现有的基于分类的方法进行修剪效果不佳,因为它们依赖于耗时的模型训练过程。为此,我们提出一种 novel Training-Free Dataset Pruning(TFDP)方法,用于实例分割。具体而言,我们利用图像标注中的形状和类别信息设计了形状复杂度评分(SCS),并将其细化为尺度不变(SI-SCS)和类别平衡(CB-SCS)版本,以解决实例面积变化和类别不平衡问题,所有工作均无需模型训练。我们在VOC 2012、Cityscapes和COCO数据集上实现了最先进的效果,跨CNN和Transformer架构均表现出良好泛化。值得注意的是,我们的方法在COCO上相较于所采纳的基线平均加快了1349倍的修剪速度。源代码已公开:https://github.com/he-y/dataset-pruning-for-instance-segmentation

关键词

引用

@article{arxiv.2503.00828,
  title  = {Training-Free Dataset Pruning for Instance Segmentation},
  author = {Yalun Dai and Lingao Xiao and Ivor W. Tsang and Yang He},
  journal= {arXiv preprint arXiv:2503.00828},
  year   = {2025}
}

备注

Accepted by ICLR 2025