Nash CoT:基于偏好均衡的多路径推理
计算与语言
2024-12-31 v3 人工智能
计算机科学与博弈论
机器学习
摘要
链式思维(CoT)是一种可增强大型语言模型(LLM)在复杂推理任务上性能的推理框架。其中,多路径推理是众多与CoT相关研究中最具代表性的简单而有效的改进之一。然而,目前尚无最佳设置用于推理路径的数量。因此,我们不得不增加推理路径的数量以获得更好的结果,这反过来又增加了推理成本。为此,我们可以利用与问题相关的角色模板来指导LLM扮演相关角色,从而增加每条路径正确推理的可能性,进一步减少对推理路径数量的依赖,同时提高推理准确性。然而,将LLM置于特定角色可能会降低其推理多样性和在角色依赖性较低的少数任务上的性能。为缓解LLM过度沉浸于特定角色的问题,我们提出了Nash CoT,通过在每条路径上构建一个游戏系统来平衡来自角色特定LLM和通用LLM生成的内容,从而确保有效的角色采用和LLM生成的多样性,进一步保持多路径推理的性能,同时减少推理路径数量的要求。我们在各种推理任务上对Nash CoT进行了评估,包括阿拉伯语推理、常识问答和符号推理,实现的效果相当于或优于相同数量的多路径CoT。
引用
@article{arxiv.2407.07099,
title = {Nash CoT: Multi-Path Inference with Preference Equilibrium},
author = {Ziqi Zhang and Cunxiang Wang and Xiong Xiao and Yue Zhang and Donglin Wang},
journal= {arXiv preprint arXiv:2407.07099},
year = {2024}
}