基于半监督伪标签的标签高效数据集修剪
量子物理
2026-05-25 v1 广义相对论与量子宇宙学
摘要
数据集修剪通过从大型数据集中选择信息丰富的子集来减少深度学习的存储和训练成本。然而,大多数现有修剪方法需要完全标注的数据,限制了其在现实场景中应用,因为在这些场景中标注数据稀缺且标注成本高昂。最近的无标签修剪方法依赖于来自预训练模型的特征来估计样本难度,这种依赖在目标数据集与预训练分布显著不同时可能不可靠。我们提出了SemiPrune——一种标签高效的数据集修剪框架,仅使用小量随机标注数据,通过半监督学习为 unlabeled 数据生成伪标签,使基于监督学习的修剪方法能够无缝应用于由伪标签构成的训练池中。随后,我们基于伪标签引起的训练动力学来估计样本难度,并选择一个 coreset。通过直接从目标数据集中学习,我们的方法更好地捕获目标分布,为难度估计和 coreset 选择提供更可靠的信号。在域特定、图像损坏和长尾数据集上验证,我们的方法在无标签和标签高效的基线中实现了最先进的性能,同时在标准基准上也表现出竞争力。
引用
@article{arxiv.2605.23197,
title = {Anomalous Decay of Quantum Resources: The Entanglement Sudden Death Mpemba Effect},
author = {Zhilong Liu and Zehua Tian and Jieci Wang},
journal= {arXiv preprint arXiv:2605.23197},
year = {2026}
}
备注
7 pages, 5 figures