将数据蒸馏到神经场
计算机视觉与模式识别
2025-03-10 v1 人工智能
机器学习
摘要
利用大规模数据集是训练高性能深度学习模型的必需品,但也带来了巨大的计算和存储成本。为克服这些挑战,数据蒸馏(dataset distillation)作为一种通过压缩大规模数据集为保留训练所必需信息的较小合成数据集而呈现出前景。本文提出了一种新颖的参数化框架,用于数据蒸馏,称为 Distilling Dataset into Neural Field(DDiF),其利用神经场存储大规模数据集所需的必要信息。由于神经场独特的特性——即其输入为坐标,输出为数量——DDiF有效地保留了信息,并轻松生成各种形状的数据。我们理论上确认,DDiF 在单一合成实例的预算相同的情况下,具有更大的表达能力。通过大量实验,我们展示了 DDiF 在多个基准数据集上实现了卓越的性能,扩展范围不仅限于图像领域,还包括视频、音频和3D体素。我们在 https://github.com/aailab-kaist/DDiF 上发布了代码。
引用
@article{arxiv.2503.04835,
title = {Distilling Dataset into Neural Field},
author = {Donghyeok Shin and HeeSun Bae and Gyuwon Sim and Wanmo Kang and Il-Chul Moon},
journal= {arXiv preprint arXiv:2503.04835},
year = {2025}
}
备注
The Thirteenth International Conference on Learning Representations (ICLR 2025)