监督链式思维
计算与语言
2024-10-21 v1 人工智能
摘要
大型语言模型(LLM)已彻底革新了自然语言处理领域,并具有巨大的潜力推动人工智能的发展。然而,主流大多数 LLM 的核心架构——变换器——在计算深度上存在内在局限,使其在理论上无法解决许多需要日益深入计算的推理任务。链式思维(Chain of Thought,CoT)提示技术已涌现出来,用于缓解这些架构局限,证据表明其效果显著。它为解决此前超出这些模型能力范围的复杂推理任务提供了有前景的途径。尽管已取得成功,但 CoT 及其变体(如 Tree of Thought、Graph of Thought 等)依赖于“一种提示适用于所有任务”的方法,对广泛任务范围(从计数和排序到解决数学和算法问题)使用单一提示结构(例如“逐步思考”)。这种方法为模型生成正确推理步骤带来了重大挑战,因为模型必须在庞大的提示模板空间中寻找为每个任务找到合适的模板。在本工作中,我们在先前的 CoT 理论分析基础上,展示了“一种提示适用于所有”方法对 LLM 可计算性产生负面影响。我们将解答搜索空间分为两个:提示空间和答案空间。我们的发现表明,针对特定任务的监督对于准确导航提示空间并实现最佳性能至关重要。通过针对最先进 LLM 的实验,我们揭示了在应用监督 versus 不应用监督时,推理性能之间存在差距。
引用
@article{arxiv.2410.14198,
title = {Supervised Chain of Thought},
author = {Xiang Zhang and Dujian Ding},
journal= {arXiv preprint arXiv:2410.14198},
year = {2024}
}