中文

基于 Hopfield 视角的链路思考推理解释

计算与语言 2024-06-19 v1 人工智能 人机交互 机器学习

摘要

链路思考(Chain-of-Thought,CoT)在增强大语言模型(LLM)的推理性能方面发挥着重要作用。虽然一些研究致力于通过检索增强等方法提高 CoT 的准确性,但对于 CoT 为何能够取得如此成功的严格解释仍然不清晰。本文在两种不同设置下对 CoT 方法进行分析,通过回答以下问题来探讨:(1)在零样本 CoT 中,为何对模型施加“让我们逐步思考”的提示会显著影响其输出?(2)在少量样本 CoT 中,为何在提问前提供示例会显著提升模型的推理能力?为回答这些问题,本文从 Hopfield 视角开展自上而下的可解释分析,提出一种名为 Read-and-Control 的方法,用于控制 CoT 的准确性。通过在七个数据集上的大量实验(涵盖三个不同任务),我们展示了该框架能够解密 CoT 的内部工作原理,提供推理错误定位,并控制其走向正确推理路径的能力。

关键词

引用

@article{arxiv.2406.12255,
  title  = {A Hopfieldian View-based Interpretation for Chain-of-Thought Reasoning},
  author = {Lijie Hu and Liang Liu and Shu Yang and Xin Chen and Hongru Xiao and Mengdi Li and Pan Zhou and Muhammad Asif Ali and Di Wang},
  journal= {arXiv preprint arXiv:2406.12255},
  year   = {2024}
}

备注

21 pages