中文

神经符号协作蒸馏:提升小型语言模型在复杂推理任务中的表现

计算与语言 2025-02-19 v4

摘要

本文提出了一种新颖的知识蒸馏方法,用于学习大型语言模型(LLM,如 >13B 参数)在复杂推理任务中的能力。我们认为,复杂推理任务对小型语言模型(SLM,如 ≤7B 参数)而言具有挑战性,因为这些任务不仅需要通用认知能力,还需要专业知识,而这种专业知识往往稀疏且难以被基于神经网络的 SLM 有效捕获。因此,NesyCD 通过不同方式从教师 LLM 中蒸馏出通用能力与专业知识。一方面,我们仅从教师 LLM 中提取通用能力蒸馈到参数化神经网络的学生 SLM 中。另一方面,对于复杂推理任务的专业能力和罕见知识,我们采用符号知识蒸馏方法,从而获取并存储于符号知识库(KB)中。通过解耦通用与专业能力,所提出的 NesyCD 能够高性价比地实现卓越的性能,既使用较小的模型,又将参数化神经网络与符号知识库相结合。此外,专业知识库能够良好地泛化,并且可以被人类理解和操作。我们的实验表明,NesyCD 在域内(BBH、GSM8K)和域外(AGIEval、ARC)数据集上显著提升了 SLM 的复杂推理性能。值得注意的是,尽管 LLaMA3-70B 参数数量是后者的 9 倍,我们的方法使 LLaMA3-8B 和 Qwen2-7B 的性能超过 GPT-3.5-turbo,并接近匹配 LLaMA3-70B。我们的代码将在 https://github.com/Xnhyacinth/NesyCD 上提供。

关键词

引用

@article{arxiv.2409.13203,
  title  = {Neural-Symbolic Collaborative Distillation: Advancing Small Language Models for Complex Reasoning Tasks},
  author = {Huanxuan Liao and Shizhu He and Yao Xu and Yuanzhe Zhang and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2409.13203},
  year   = {2025}
}

备注

Accepted to AAAI 2025