中文

DialCoT 遇见 PPO:在较小语言模型中分解与探索推理路径

计算与语言 2023-10-24 v3 人工智能

摘要

思维链(CoT)提示已被证明能有效增强参数量至少 1000 亿的大语言模型(LLMs)的推理能力。然而,当应用于参数量小于 100 亿的较小语言模型(SLMs)的推理任务时,它无效甚至有害。为解决此局限,我们引入了对话引导思维链(DialCoT),其采用对话格式生成中间推理步骤,引导模型走向最终答案。此外,我们利用近端策略优化(PPO)算法优化模型的推理路径选择,进一步增强其推理能力。相较以往方法,我们的方法具有若干优势。首先,我们将复杂推理问题的求解转化为一系列更简单的子问题,显著降低任务难度,使其更适用于 SLMs。其次,我们通过 PPO 算法优化模型的推理路径选择。我们在四个算术推理数据集上进行了综合实验,表明我们的方法相较最先进的竞争对手取得了显著的性能提升。

关键词

引用

@article{arxiv.2310.05074,
  title  = {DialCoT Meets PPO: Decomposing and Exploring Reasoning Paths in Smaller Language Models},
  author = {Chengcheng Han and Xiaowei Du and Che Zhang and Yixin Lian and Xiang Li and Ming Gao and Baoyuan Wang},
  journal= {arXiv preprint arXiv:2310.05074},
  year   = {2023}
}

备注

Accepted to EMNLP 2023