中文

链式偏好优化:改进大语言模型中的思维链推理

计算与语言 2024-11-01 v2 机器学习

摘要

近期思维链(CoT)解码的发展使大语言模型(LLMs)能够为复杂问题求解生成显式的逻辑推理路径。然而,研究表明这些路径并非总是深思熟虑且最优的。思维树(ToT)方法采用树搜索来广泛探索推理空间,并找到CoT解码可能忽略的更优推理路径。然而,这种深思熟虑是以显著增加推理复杂度为代价的。在这项工作中,我们证明,利用ToT构建的搜索树对LLMs进行微调,可以使CoT达到相似或更好的性能,从而避免巨大的推理负担。这是通过链式偏好优化(CPO)实现的,其中LLMs被微调以利用树搜索过程中固有的偏好信息,使CoT推理路径的每一步与ToT的路径对齐。大量的实验结果表明,CPO显著提升了LLMs在解决各种复杂问题(包括问答、事实验证和算术推理)上的性能,证明了其有效性。我们的代码可在 https://github.com/sail-sg/CPO 获取。

关键词

引用

@article{arxiv.2406.09136,
  title  = {Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs},
  author = {Xuan Zhang and Chao Du and Tianyu Pang and Qian Liu and Wei Gao and Min Lin},
  journal= {arXiv preprint arXiv:2406.09136},
  year   = {2024}
}

备注

NeurIPS 2024