基于 Wasserstein 度量的数据集蒸馏
计算机视觉与模式识别
2025-07-03 v3 人工智能
机器学习
摘要
数据集蒸馏(DD)旨在生成紧凑的合成数据集,使模型能达到与在完整大型数据集上训练相当的性能,从而显著降低计算成本。借鉴最优传输理论,我们提出 WMDD(基于 Wasserstein 度量的数据集蒸馏),一种简洁而强大的方法,采用 Wasserstein 度量来增强分布匹配。我们计算预训练分类器特征的 Wasserstein 重心以捕捉原始数据分布的本质特征。通过在特征空间中优化合成数据与该重心对齐,并利用逐类 BatchNorm 统计量保留类内变化,WMDD 在保持分布匹配方法效率的同时,在各种高分辨率数据集上取得了最先进(SOTA)结果。我们大量实验证明了 WMDD 的有效性与适应性,凸显了其在大规模推进机器学习应用方面的潜力。
引用
@article{arxiv.2311.18531,
title = {Dataset Distillation via the Wasserstein Metric},
author = {Haoyang Liu and Yijiang Li and Tiancheng Xing and Peiran Wang and Vibhu Dalal and Luwei Li and Jingrui He and Haohan Wang},
journal= {arXiv preprint arXiv:2311.18531},
year = {2025}
}
备注
Accepted to ICCV 2025. Project page at https://liu-hy.github.io/WMDD/ and code is available at https://github.com/Liu-Hy/WMDD