从讨好到sense-making:面向人类- AI决策的前提治理
计算与语言
2026-03-26 v2 人工智能
摘要
随着 LLM 从协助工具扩展到决策支持,出现一种危险模式:流畅的同意而无校准的判断。低阻力的助手可能变得讨好,内化隐式假设,将验证成本转嫁给专家,而结果又到来得太晚,无法作为奖励信号。在深度不确定性决策中(目标有争议且无法轻易逆转),扩大流畅同意的规模会比建立专业知识更快地放大 Poor commitments。我们认为可靠的人类- AI 合作需要从答案生成转向对知识基底的前提治理,仅对决策关键性事项进行协商。一个基于差异驱动的控制循环在该基底上运行:检测冲突,通过类型化差异(teleological、epistemic、procedural)局部化误差不一致,并触发受限协商通过 decision slices。承诺门控阻止对未经授权的承载性前提采取行动,除非在记录风险下被覆盖;价值门控分配探索性任务,基于交互成本。信任随后附着于可审计的前提和证据标准,而非对话流畅性。我们以辅导场景为例,提出可检验的评估标准。
引用
@article{arxiv.2602.02378,
title = {From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making},
author = {Raunak Jain},
journal= {arXiv preprint arXiv:2602.02378},
year = {2026}
}