基于委员会投票的数据集蒸馏
计算机视觉与模式识别
2026-02-17 v2 人工智能
摘要
数据集蒸馏旨在合成一个紧凑但具有代表性的数据集,保留原始数据的基本特征,以实现高效的模型训练。现有方法主要关注改进数据合成对齐或扩展蒸馏到大规模数据集。在这项工作中,我们提出了委员会投票数据集蒸馏(CV-DD),这是一种正交方法,利用多个模型的集体知识来生成更高质量的蒸馏数据。我们首先建立了一个强大的基线,通过现代架构和优化选择实现了最先进的性能。通过整合多个模型的分布和预测并生成高质量的软标签,我们的方法捕获了更广泛的数据特征,减少了模型特定偏差和分布偏移的影响,并显著提高了泛化能力。这种基于投票的策略增强了多样性和鲁棒性,减轻了过拟合,并提高了后评估性能。在多个数据集和IPC设置上的大量实验表明,CV-DD始终优于单模型和多模型蒸馏方法,并且很好地泛化到非训练框架和具有挑战性的合成到真实迁移任务。代码可在https://github.com/Jiacheng8/CV-DD获取。
引用
@article{arxiv.2501.07575,
title = {Dataset Distillation via Committee Voting},
author = {Jiacheng Cui and Zhaoyi Li and Xiaochen Ma and Xinyue Bi and Yaxin Luo and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2501.07575},
year = {2026}
}
备注
Code at: https://github.com/Jiacheng8/CV-DD