并非所有实例都同等重要:面向影响加权数据蒸馏
机器学习
2025-11-03 v1 人工智能
摘要
数据蒸馏将大数据集压缩为合成子集,在大幅减少存储和计算成本的同时,实现了与在完整数据集上训练相当的性能。大多数现有数据蒸馈方法假设所有真实实例在过程中的贡献相等。实际中,真实数据集包含信息丰富且既有冗余或甚至有害的实例,直接在不考虑数据质量的情况下蒸馈完整数据集可能降低模型性能。本文提出影响加权蒸馈(IWD),一个原则性框架,利用影响函数显式考虑数据质量在蒸馈过程中的作用。IWD根据每个实例对蒸馈目标的估计影响为其分配自适应权重,优先考虑有益数据,同时压低不够有用或有害的数据。凭借其模块化设计,IWD可无缝集成到各种数据蒸馈框架中。我们的实证结果表明,集成IWD倾向于提高蒸馈数据集的质量并提升模型性能,其中准确率提升幅度可达7.8%。
引用
@article{arxiv.2510.27253,
title = {Not All Instances Are Equally Valuable: Towards Influence-Weighted Dataset Distillation},
author = {Qiyan Deng and Changqian Zheng and Lianpeng Qiao and Yuping Wang and Chengliang Chai and Lei Cao},
journal= {arXiv preprint arXiv:2510.27253},
year = {2025}
}