利用条件互信息改进大型语言模型分类微调
计算与语言
2025-05-01 v2
摘要
尽管大型语言模型(LLM)在近年来展示了显著的能力,但信息论(IT)来增强LLM开发的潜力仍未得到充分探索。本文将条件互信息(CMI)的信息论原理引入LLM分类任务的微调中,主要通过两种方式探索其前景:最小化CMI以提高模型的独立性能,以及最大化CMI以增强知识蒸馏(KD),从而培养更具能力的学生模型。为了在LLM微调中应用CMI,我们对最近提出的CMI约束深度学习框架进行了调整,该框架最初是为图像分类开发的,并做了一些修改。通过在LLM微调期间最小化CMI,我们在8个GLUE分类任务中的6个上相比BERT实现了更优的性能提升。此外,在KD过程中最大化CMI,在8个GLUE分类任务中的6个上相比DistilBERT取得了显著的性能提升。这些发现证明了CMI在优化独立LLM和学生模型方面的适应性,展示了其作为推进LLM微调的稳健框架的潜力。我们的工作弥合了信息论与LLM开发之间的差距,为构建高性能语言模型提供了新的见解。
引用
@article{arxiv.2502.11258,
title = {Leveraging Conditional Mutual Information to Improve Large Language Model Fine-Tuning For Classification},
author = {Thanushon Sivakaran and En-Hui Yang},
journal= {arXiv preprint arXiv:2502.11258},
year = {2025}
}
备注
6 pages, 2 figures, Published to IEEE ISIT 2025