预算有限的 LLM:主动知识蒸馏用于高效分类大文本语料
机器学习
2025-11-18 v1
摘要
大型语言模型(LLM)在分类任务中表现高度准确,但其巨大的计算和经济成本阻碍了在动态环境中的大规模部署。知识蒸馏(Knowledge Distillation, KD)通过让 LLM 的“教师”模型训练一个更小更高效的“学生”模型,为解决这一问题提供了有前景的途径。然而,蒸馏过程本身对大数据集仍然成本高昂,因为需要教师模型为大量样本标注且代价巨大。为缓解这一挑战,本文探索了主动学习(Active Learning, AL)作为在保持 LLM 性能的前提下,以更少成本创建高效学生模型的方法。具体而言,我们引入了 M-RARU(Multi-class Randomized Accept/Reject Uncertainty Sampling),一种新颖的 AL 算法,显著降低了训练成本。M-RARU 采用一种创新策略,将不确定性与随机接受-拒绝机制结合,用于仅选择教师模型最具信息性的数据点。这种聚焦方法显著最小化了所需的 API 调用次数和数据处理时间。我们在多个基准数据集上评估了 M-RARU 与随机抽样在五种多样化学生模型(SVM、LDA、RF、GBDT 和 DistilBERT)之间的表现。实验表明,我们的 proposed 方法相较于随机抽样可实现最高 80% 的样本需求降低,显著提高了分类准确率,同时降低了经济成本和整体训练时间。
引用
@article{arxiv.2511.11574,
title = {LLM on a Budget: Active Knowledge Distillation for Efficient Classification of Large Text Corpora},
author = {Viviana Luccioli and Rithika Iyengar and Ryan Panley and Flora Haberkorn and Xiaoyu Ge and Leland Crane and Nitish Sinha and Seung Jung Lee},
journal= {arXiv preprint arXiv:2511.11574},
year = {2025}
}