Chip-Tuning:在语言模型说出答案前对其进行分类
计算与语言
2024-10-14 v2 人工智能
摘要
大语言模型(LLM)性能的快速发展伴随着模型规模的不断增大,导致模型训练和推理成本日益增加。以前的研究发现,LLM 的某些层存在冗余性,删除这些层仅会导致轻微的性能损失。本文采用探针技术来解释 LLM 中的层冗余,并演示语言模型可以通过训练探针分类器来有效地进行裁剪。我们提出了 chip-tuning,一种专为分类问题设计的简单且高效的结构化裁剪框架。chip-tuning 将名为芯片的微型探针分类器附加到 LLM 的不同层,并在 Backbone 模型冻结的情况下训练芯片。 After 选择一个用于分类的芯片,所有后续于该附加层的层都可以被删除,而不会对性能产生显著影响。在各种 LLM 和数据集上进行的实验结果表明,chip-tuning 在准确率和裁剪比率方面均显著优于以前的 state-of-the-art 基线,实现了最高可达 50% 的裁剪比率。我们也发现 chip-tuning 可用于多模态模型,并且可以与模型微调结合,证明其卓越的兼容性。
关键词
引用
@article{arxiv.2410.06541,
title = {Chip-Tuning: Classify Before Language Models Say},
author = {Fangwei Zhu and Dian Li and Jiajun Huang and Gang Liu and Hui Wang and Zhifang Sui},
journal= {arXiv preprint arXiv:2410.06541},
year = {2024}
}