基于信息素的最优推理路径学习
计算与语言
2025-02-03 v1
摘要
大语言模型(LLM)通过思维链提示展示了卓越的推理能力,然而由于可能中间步骤的空间极其庞大,为复杂问题发现有效的推理方法仍具挑战。我们引入了蚁群优化引导的思维树(ACO-ToT),这是一种将 ACO 与 LLM 相结合以高效发现复杂问题最优推理路径的新算法。受神经系统中赫布学习的启发,我们的方法采用一组经过独特微调的 LLM“蚂蚁”来遍历并在中心化的思维树中留下信息素轨迹,每只蚂蚁的移动由现有信息素轨迹及其自身专业知识的加权组合所支配。该算法使用基于混合专家的评分函数评估完整的推理路径,并通过信息素在迭代中强化有效的推理路径。在三个具有挑战性的推理任务(GSM8K、ARC-Challenge 和 MATH)上的实验表明,ACO-ToT 的表现显著优于现有的思维链优化方法,这表明将受生物学启发的集体搜索机制纳入 LLM 推理可以大幅增强推理能力。
引用
@article{arxiv.2501.19278,
title = {Pheromone-based Learning of Optimal Reasoning Paths},
author = {Anirudh Chari and Aditya Tiwari and Richard Lian and Suraj Reddy and Brian Zhou},
journal= {arXiv preprint arXiv:2501.19278},
year = {2025}
}