链路思维提示的通用验证方法
计算与语言
2024-05-02 v1 人工智能
摘要
许多最近由大语言模型(LLM)展示的能力主要源于其利用上下文信息的能力。本文探讨了通过(1)探索不同的思考链和(2)验证推理过程的各个步骤来提高LLM推理能力的方法。我们提出了模型在推理时应遵循的三个通用原则:(i)相关性,(ii)数学准确性,和(iii)逻辑一致性。我们将这些约束应用于LLM生成的推理步骤,以提高最终生成结果的准确性。这些约束以验证器的形式应用:模型被要求验证生成的步骤是否满足每个约束。为进一步引导生成高质量解决方案,我们使用推理步骤的困惑度作为额外的验证器。我们在4种不同类型的推理任务上进行评估,涵盖9个不同的数据集。实验表明,我们的方法总体优于 vanilla 生成,在9个数据集中的6个上优于最佳N抽样方法,该方法抽样N条思考链并挑选最低困惑度的生成结果。
引用
@article{arxiv.2405.00204,
title = {General Purpose Verification for Chain of Thought Prompting},
author = {Robert Vacareanu and Anurag Pratik and Evangelia Spiliopoulou and Zheng Qi and Giovanni Paolini and Neha Anna John and Jie Ma and Yassine Benajiba and Miguel Ballesteros},
journal= {arXiv preprint arXiv:2405.00204},
year = {2024}
}
备注
22 pages, preprint