中文

Critical-Questions-of-Thought:通过论证查询引导LLM推理

人工智能 2024-12-20 v1 计算与语言

摘要

研究表明,尽管AI研究取得了突破性进展,甚至是最先进的大型语言模型(LLM)在执行逻辑和数学推理方面仍然困扰。结果似乎表明,LLM仍然工作像(高度发达的)数据模式识别器,在尝试推广和解决模型从未见过的推理问题或训练数据中不接近的样本时得分较差。为解决这一迫切关注,本文运用论证理论文献中的 critical questions 的概念,特别聚焦于 Toulmin 的论证模型。我们展示,运用这些 critical questions 可以提高LLM的推理能力。通过探测模型推理过程背后的理由,LLM可以评估是否存在某种逻辑错误并在提供最终回复之前对其进行纠正。其 underlying idea 源自任何有效论证程序的 gold standard:如果论点被接受的前提所蕴含,则结论是有效的。或者,用一种在现实中近似于阿基米德原则的话语概括,特征于信息不完整和假设逻辑,结论是有效的,如果没有被证明为无效。该方法成功地通过推理管道引导模型的输出,在基线及其 Chain-of-Thought(CoT) 实现之后取得更好的性能。为此,我们在MT-Bench推理和数学任务上对所提出方法进行了广泛评估,涵盖多种LLM。

关键词

引用

@article{arxiv.2412.15177,
  title  = {Critical-Questions-of-Thought: Steering LLM reasoning with Argumentative Querying},
  author = {Federico Castagna and Isabel Sassoon and Simon Parsons},
  journal= {arXiv preprint arXiv:2412.15177},
  year   = {2024}
}