小语言模型能否帮助大语言模型更好地推理?:LM引导的思维链
计算与语言
2024-04-05 v1 人工智能
摘要
我们引入了一个新颖的框架 LM-Guided CoT,该框架利用轻量级(即 <1B)语言模型(LM)来引导黑盒大型(即 >10B)LM 完成推理任务。具体而言,轻量级 LM 首先为每个输入实例生成一个基本原理。然后提示冻结的大型 LM 根据轻量级 LM 生成的基本原理来预测任务输出。我们的方法在资源上是高效的,因为它只需要训练轻量级 LM。我们通过 1)知识蒸馏和 2)基于面向基本原理和面向任务的奖励信号的强化学习来优化模型。我们使用多跳抽取式问答(QA)基准 HotpotQA 和 2WikiMultiHopQA 评估了我们的方法。实验结果表明,我们的方法在答案预测准确率方面优于所有基线。我们还发现,强化学习有助于模型产生更高质量的基本原理,从而提升了 QA 性能。
引用
@article{arxiv.2404.03414,
title = {Can Small Language Models Help Large Language Models Reason Better?: LM-Guided Chain-of-Thought},
author = {Jooyoung Lee and Fan Yang and Thanh Tran and Qian Hu and Emre Barut and Kai-Wei Chang and Chengwei Su},
journal= {arXiv preprint arXiv:2404.03414},
year = {2024}
}
备注
This paper is accepted to LREC-COLING 2024