数据集值约 1 MB
机器学习
2026-02-27 v1 计算机视觉与模式识别
摘要
数据集服务器经常需要向众多客户端分发相同的大型数据载荷,造成巨大的通信成本。由于客户端常在多样化的硬件和软件框架上运行,传输预训练模型往往不可行;相反,代理人需要原始数据才能在本地针对特定任务进行训练。虽然数据集蒸馏试图压缩训练信号,但当前方法在高分辨率数据上难以扩展,且很少实现足够小的文件。本文提出了伪标签作为数据(PLADA)方法,彻底消除像素传输。我们假设代理人预装有大型通用无标签参考数据集(如 ImageNet-1K、ImageNet-21K),并通过仅传输特定图像的类别标签来传递新任务。为解决参考数据集与目标数据集之间的分布不匹配,我们引入一种修剪机制,筛选出与目标任务最语义相关的图像标签。这种选择过程同时最大化训练效率并最小化传输数据载荷。在 10 个多样化数据集上的实验表明,我们的方法可在小于 1 MB 的数据载荷下实现任务知识传递,同时保持高分类准确率,为高效数据集服务提供了有前景的解决方案。
引用
@article{arxiv.2602.23358,
title = {A Dataset is Worth 1 MB},
author = {Elad Kimchi Shoshani and Leeyam Gabay and Yedid Hoshen},
journal= {arXiv preprint arXiv:2602.23358},
year = {2026}
}
备注
23 pages, 9 figures