中文

通过校准数据精选保留 LLM 能力:从分析到优化

计算与语言 2025-10-14 v1

摘要

后训练压缩是一种广泛采用的方法,用于缩小大型语言模型 (LLM),以便高效推理。在各种提出的压缩方法中,包括剪枝和量化,校准数据在告知权重重要性和激活动态范围方面发挥着关键作用。然而,校准数据如何影响压缩后 LLM 的能力仍较少探讨。虽然已有少数作品虽认识到这一研究的重要性,但仅从数据来源或样本数量等有限角度检视语言建模或常识推理性能的降低。仍需更系统的研究来检视校准数据在 LLM 不同能力——具体而言是组合属性和领域对应性——上的影响。在本工作中,我们旨在弥合这一差距,并从激活模式的角度进一步分析潜在影响机制。尤其,我们探讨校准数据对高级复杂推理能力的影响,如数学问题解决和代码生成。深入探究底层机制,我们发现激活空间中的代表性和多样性更根本地决定校准数据的质量。最终,我们提出一种基于上述观察和分析的校准数据精选框架,提高了现有后训练压缩方法在保留关键 LLM 能力方面的性能。我们的代码提供于 \href{https://github.com/BokwaiHo/COLA.git}{链接}。

关键词

引用

@article{arxiv.2510.10618,
  title  = {Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization},
  author = {Bowei He and Lihao Yin and Huiling Zhen and Shuqi Liu and Han Wu and Xiaokun Zhang and Mingxuan Yuan and Chen Ma},
  journal= {arXiv preprint arXiv:2510.10618},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025