固定锚点不够:基于动态检索和持久同调的Dataset Distillation
计算机视觉与模式识别
2026-03-18 v3
摘要
解耦式数据蒸馏(DD)通过匹配冻结教师的统计信息将大型语料库压缩为少量合成图像。然而,当前残差匹配管道依赖静态真实补丁,导致拟合复杂度鸿沟和拉到锚点的效应,从而降低类内多样性并损害泛化能力。为此,我们引入RETA——面向解耦式DD的检索和拓扑对齐框架。首先,动态检索连接(DRC)从预构建的池中选择一个真实补丁,以最小化教师特征空间中的拟合复杂度得分;该选取的补丁通过残差连接注入以紧密匹配特征,同时控制注入复杂度。其次,持久拓扑对齐(PTA)利用持久同调正则化合成:我们构建双向k近邻特征图,计算各成分和环的持久图像,并对真实集和合成集之间的拓扑差异进行惩罚,从而缓解拉到锚点的效应。在CIFAR-100、Tiny-ImageNet、ImageNet-1K以及多个ImageNet子集上,RETA在相当的时间和内存开销下 consistently 超过各种基线方法,尤其在ResNet-18上以每类50张图像实现64.3%的top-1准确率,比最佳先前方法高出3.1%。
引用
@article{arxiv.2602.24144,
title = {Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation},
author = {Muquan Li and Hang Gou and Yingyi Ma and Rongzheng Wang and Ke Qin and Tao He},
journal= {arXiv preprint arXiv:2602.24144},
year = {2026}
}
备注
Accepted to CVPR 2026