学习最大化互信息以进行思维链蒸馏
计算与语言
2024-06-11 v3 人工智能
摘要
知识蒸馏是将知识从大型复杂模型转移到小型模型的技术,标志着迈向高效人工智能部署的关键一步。逐步蒸馏(Distilling Step-by-Step, DSS)是一种利用思维链(Chain-of-Thought, CoT)蒸馏的新方法,通过赋予小型模型与其大型对应模型相当的卓越推理能力而展现出前景。在 DSS 中,蒸馏模型通过多任务学习框架同时获得生成理由和预测标签的能力。然而,DSS 忽略了两个训练任务之间的内在联系,导致 CoT 知识与标签预测任务的整合效果不佳。为此,我们从信息瓶颈(Information Bottleneck)视角研究这两个任务的相互关系,并将其表述为最大化两个任务表示特征的互信息。我们提出了一种基于学习的方法来求解该优化问题的变分方案。在四个数据集上的实验结果表明,我们的方法优于最先进的 DSS。我们的发现为语言模型蒸馏及涉及 CoT 的应用的未来研究提供了富有洞察力的指导。代码地址:\url{https://github.com/xinchen9/cot_distillation_ACL2024}。
引用
@article{arxiv.2403.03348,
title = {Learning to Maximize Mutual Information for Chain-of-Thought Distillation},
author = {Xin Chen and Hanxian Huang and Yanjun Gao and Yi Wang and Jishen Zhao and Ke Ding},
journal= {arXiv preprint arXiv:2403.03348},
year = {2024}
}
备注
Accepted to ACL 2024 Findings