中文

利用条件互信息改进大型语言模型分类微调

计算与语言 2025-05-01 v2

摘要

尽管大型语言模型(LLM)在近年来展示了显著的能力,但信息论(IT)来增强LLM开发的潜力仍未得到充分探索。本文将条件互信息(CMI)的信息论原理引入LLM分类任务的微调中,主要通过两种方式探索其前景:最小化CMI以提高模型的独立性能,以及最大化CMI以增强知识蒸馏(KD),从而培养更具能力的学生模型。为了在LLM微调中应用CMI,我们对最近提出的CMI约束深度学习框架进行了调整,该框架最初是为图像分类开发的,并做了一些修改。通过在LLM微调期间最小化CMI,我们在8个GLUE分类任务中的6个上相比BERT实现了更优的性能提升。此外,在KD过程中最大化CMI,在8个GLUE分类任务中的6个上相比DistilBERT取得了显著的性能提升。这些发现证明了CMI在优化独立LLM和学生模型方面的适应性,展示了其作为推进LLM微调的稳健框架的潜力。我们的工作弥合了信息论与LLM开发之间的差距,为构建高性能语言模型提供了新的见解。

关键词

引用

@article{arxiv.2502.11258,
  title  = {Leveraging Conditional Mutual Information to Improve Large Language Model Fine-Tuning For Classification},
  author = {Thanushon Sivakaran and En-Hui Yang},
  journal= {arXiv preprint arXiv:2502.11258},
  year   = {2025}
}

备注

6 pages, 2 figures, Published to IEEE ISIT 2025