中文

思考思考:SAGE-nano 的逆推推理实现自我认知语言模型

人工智能 2025-07-02 v1 计算与语言 机器学习

摘要

大型语言模型(LLM)在利用链式思维(CoT)提示解决复杂推理任务方面显示出惊人的能力,但其决策过程仍显得黑箱。我们引入逆推推理(inverse reasoning),这是一种新颖的范式,使 LLM 能够对事后分解和解释自己的推理链。我们的 method 用于 SAGE-nano,一个 40 亿参数的推理模型,采用一种 metacognitive 结构,通过注意力过程反思以识别主要决策点并生成推理选择的解释。虽然典型的 CoT 方法侧重于正向推理生成,但逆推推理提供了为何选择特定推理链而其他推理链的洞见。通过对逻辑推理谜题、数学问题和伦理困境进行全面测试(来自 AQUA-RAT、CommonsenseQA 和定制基准),我们展示了 SAGE-nano 在推理准确率(AQUA-RAT 上为 74.6%)和解释质量(92.1% 人类偏好得分)方面处于行业领先水平,性能几乎与 Claude-3.5 Sonnet 或 GPT-4o 挥之不竭。我们的贡献包括:(i)首个严谨的 LLM 自我反思框架基于逆推推理,(ii)一种新的 metalearning 框架以反转注意力流,(iii)推理透明度的全面评估框架,以及(iv)证明使用逆推推理提高推理能力的证据。我们的工作为透明 AI 系统开辟了新方向,并缩小了 AI 安全、教育和科学发现之间的显著差距。

关键词

引用

@article{arxiv.2507.00092,
  title  = {Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models},
  author = {Basab Jha and Firoj Paudel and Ujjwal Puri and Zhang Yuting and Choi Donghyuk and Wang Junhao},
  journal= {arXiv preprint arXiv:2507.00092},
  year   = {2025}
}

备注

19 pages, 2 figures, 9 tables