推理陷阱——逻辑推理作为 situational awareness 的机制路径
人工智能
2026-03-11 v1 计算与语言
计算机与社会
机器学习
摘要
情境意识是 AI 系统识别自身本质、理解其训练和部署背景以及对自身情境进行战略推理的能力,被广泛认为是高级 AI 系统中最危险的新兴能力。独立地,越来越多的研究努力提升大型语言模型(LLM)在演绎、归纳和归谬上的逻辑推理能力。本文认为,这两个研究轨迹正处于碰撞的轨道上。我们提出 RAISE 框架(Reasoning Advancing Into Self Examination),识别逻辑推理能力提升逐步深化情境意识的三个机制路径:演绎自推理、归纳情境识别和归谬自建模。我们对每条路径进行形式化建模,构建从基础自我识别到战略欺骗的递进梯阶,并展示每个主要的 LLM 逻辑推理研究主题都直接映射到具体的情境意识放大器上。我们进一步分析当前安全措施不足以防止这种升级的原因。我们通过提出具体的安全措施,包括“镜像测试”基准和推理安全平衡原则,并向逻辑推理社区提出一个不舒服却必需的问题:它在这一轨迹中的责任是什么。
引用
@article{arxiv.2603.09200,
title = {The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness},
author = {Subramanyam Sahoo and Aman Chadha and Vinija Jain and Divya Chaudhary},
journal= {arXiv preprint arXiv:2603.09200},
year = {2026}
}
备注
Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper