数据剪枝能发挥更大作用:面向目标重识别的对象的数据剪枝综合方法
计算机视觉与模式识别
2024-12-16 v1 人工智能
摘要
先前研究表明,在训练过程中,数据集中的每个样本的重要性不尽相同。数据剪枝旨在在仍能实现与在原始(未截断)数据集上训练相当结果的同时,移除不太重要或不够信息丰富的样本,从而减少存储和训练成本。然而,大多数数据剪枝方法都是应用于图像分类任务的。到目前为止,本工作是首次探讨将这些剪枝方法应用于目标重识别(ReID)任务的可行性,同时提出了更为全面的数据剪枝方法。通过充分利用训练期间的logit历史本方法提供了更精确、更全面的样本重要性度量指标,同时纠正误标记的样本并识别离群点。此外,本方法效率极高,相较于现有方法将重要性得分估计算术成本降低了10倍。我们的做法是一种即插即用、与网络结构无关的框架,可在VeRi、MSMT17和Market1501数据集上分别消除/减少35%、30%和5%的样本/训练时间,同时在准确率上几乎没有损失(< 0.1%)。来自这些ReID数据集中重要样本、误标记样本和离群样本的列表已提供于 https://github.com/Zi-Y/data-pruning-reid。
引用
@article{arxiv.2412.10091,
title = {Data Pruning Can Do More: A Comprehensive Data Pruning Approach for Object Re-identification},
author = {Zi Yang and Haojin Yang and Soumajit Majumder and Jorge Cardoso and Guillermo Gallego},
journal= {arXiv preprint arXiv:2412.10091},
year = {2024}
}