中文

提高小模型链式思考推理的泛化能力

机器学习 2025-01-20 v1 人工智能 计算与语言

摘要

小型语言模型中的链式思考(CoT)推理是一项具有挑战性的自然语言处理问题,但在许多实际应用场景中都极具期望价值。现有的 CoT 知识蒸馏方法常常存在保守的记忆问题,导致小型 LLM 的泛化信心较低。鉴于完全保留教师模型的 CoT 能力是不可能的,我们假设对抗 CoT 微调对于开发具备健壮 CoT 泛化能力的小型 LLM 至关重要。为此,我们提出了一种名为 PRADA(PRompt-Assisted Domain-Adversarial fine-tuning,PRompt 辅助域对抗微调)的原则性微调框架,该框架整合了多样化的 CoT 领域。具体而言,PRADA 在小型 LLM 中首创两种 CoT 改进措施:(1)通过域对抗微调恢复通常在蒸馏过程中丢失的领域无关特征洞察;(2)通过采用域对抗方法来增强 CoT 提示工程的领域适应性。我们理论上展示了该方法的有效性,并通过实证研究表明其在广泛的任务范围内显著优于现有技术。此外,我们的实证发现表明,小型 LLM 在利用 PRADA 后能够与领域知识紧密对齐,从而提高了我们方法的可解释性。

关键词

引用

@article{arxiv.2501.09804,
  title  = {Enhancing Generalization in Chain of Thought Reasoning for Smaller Models},
  author = {Maxwell J. Yin and Dingyi Jiang and Yongbing Chen and Boyu Wang and Charles Ling},
  journal= {arXiv preprint arXiv:2501.09804},
  year   = {2025}
}