中文

我们需要知识蒸馏来解决数学 word 问题

计算与语言 2025-07-08 v1

摘要

大型语言模型(LLM)的数学能力提升正在推动初中等教育领域的新发展,尤其是在智能辅导系统方面。然而,LLM 所需的计算资源较大,在教育场景下导致显著成本。为缓解此缺点,本文探讨了压缩 LLM 以解决数学 word 问题(MWPs)的可行性。我们压缩由 BERT 编码的嵌入向量,并蒸馏出一个显著更小的学生模型。研究表明,学生模型在保持约 90% 教师模型性能的同时,仅使用其参数的 1/12。除实现高准确率外,该模型展现出强大的泛化能力,压缩后的向量在所有与 MWPs 相关的任务上均表现良好,且蒸馏过程不具特定任务性。此次蒸馏的成功表明,其背后的原理是通用的,並非局限于特定任务。我们进一步探讨了嵌入向量可压缩性的原因,发现词性信息而非实体识别是 MWPs 的关键因素,这可能显著促进了其可压缩性。效率提升和成本降低为智能辅导系统带来了显著价值,显著推动了智能教育领域的发展。

关键词

引用

@article{arxiv.2507.02982,
  title  = {We Need Knowledge Distillation for Solving Math Word Problems},
  author = {Zhenquan Shen and Xinguo Yu and Xiaotian Cheng and Rao Peng and Hao Ming},
  journal= {arXiv preprint arXiv:2507.02982},
  year   = {2025}
}