频率至关重要:基于快速模型无关数据精选策略用于剪枝与量化
计算与语言
2026-05-26 v3 人工智能
摘要
训练后模型压缩对于在保持性能的同时提升大型语言模型 (LLM) 的可移植性至关重要。虽然已提出多种压缩方法,但在为找到压缩模型配置选择最合适数据集 (即“校准数据”) 方面投入的注意力较少。校准数据的选择是旨在在模型能力的内部和外部任务之间保持性能的关键步骤。本文解决识别用于剪枝和量化的高性能校准集的挑战,通过分析数据内在属性而非模型特定信号。我们引入 ZipCal,一种模型无关的数据精选策略,通过基于齐夫定律的词汇多样性最大化来实现目标。实验表明,我们的方法在 various 剪枝基准测试中 consistently 优于标准均匀随机抽样。值得注意的是,它在下游性能方面与依赖模型困惑度的 state-of-the-art 方法持平。后者在大规模模型和数据集上变得不可行,而 ZipCal 由于其可处理的线性复杂度,平均快约 240 倍。
引用
@article{arxiv.2603.16105,
title = {Frequency Matters: Fast Model-Agnostic Data Curation for Pruning and Quantization},
author = {Francesco Pio Monaco and Elia Cunegatti and Flavio Vella and Giovanni Iacca},
journal= {arXiv preprint arXiv:2603.16105},
year = {2026}
}
备注
Added statistical analysis, mechanistic analysis and a comparison with a generative baseline. 22 pages