中文

通过高斯泼溅参数化数据集蒸馏

计算机视觉与模式识别 2026-03-19 v3 人工智能

摘要

数据集蒸馏旨在压缩训练数据的同时保留训练感知知识,以缓解现代模型训练对大规模数据集的依赖。数据集参数化为数据集蒸馏提供了更高效的存储结构,减少了冗余并容纳了更丰富的信息。然而,现有方法要么依赖复杂的辅助模块,要么无法平衡表示能力与效率。在本文中,我们提出了 GSDD,一种基于高斯泼溅的简单、新颖且有效的数据集蒸馏参数化技术。我们适配了基于 CUDA 的泼溅算子以进行批处理并行训练,以最少的计算和内存开销实现高质量渲染。高斯基元能有效捕捉有意义的训练特征,从而实现对单个图像稀疏而富有表现力的表示。凭借高表示能力和高效率,GSDD 在给定存储预算下大幅增加了蒸馏数据集的多样性,从而提高了蒸馏性能。除了在多个标准基准上取得具有竞争力的结果外,GSDD 在 ImageNet-1K 等大规模数据集和视频蒸馏任务上也带来了显著的性能提升。此外,我们还进行了全面的基准测试,以评估 GSDD 的计算效率、内存占用以及跨 GPU 架构的稳定性。代码可在 https://github.com/j-cyoung/GSDatasetDistillation 获取

关键词

引用

@article{arxiv.2509.26219,
  title  = {Parameterizing Dataset Distillation via Gaussian Splatting},
  author = {Chenyang Jiang and Zhengcen Li and Hang Zhao and Qiben Shan and Shaocong Wu and Jingyong Su},
  journal= {arXiv preprint arXiv:2509.26219},
  year   = {2026}
}

备注

19 pages; Code is available on https://github.com/j-cyoung/GSDatasetDistillation