行为线索推理:可监控的推理通过监督提升效率与安全性
人工智能
2026-05-21 v2
摘要
大型语言模型 (LLMs) 的推理给监督带来了挑战,因为许多不一致的行为直到推理结束才会出现。为了解决这个问题,我们引入了行为线索推理,以使 LLM 的推理更具可控性和可监控性。行为线索是特殊的 token 序列,模型被训练为在特定隐式和显式行为之前立即发出,充当双重目的的信号和控制杠杆。当使用强化学习微调较弱的外部监视器以进行推理监督时,仅由行为线索呈现的信息的压缩视图就足以作为信号,使监视器能够在复杂数学问题求解中修剪高达 50% 否则会被浪费的推理 token。当在过度约束违规会导致失败的环境中被近乎最优的基于规则的监视器利用时,行为线索允许从 80% 否则会以提出不安全行为结束的推理轨迹中恢复安全行为,将成功率从 46% 提高到 96%,增加了一倍多。通过在两个模型族和三个领域中进行评估,我们表明行为线索推理提高了推理的可监控性和可控性,且不牺牲性能。更广泛地说,我们的工作推进了可扩展监督,通过展示如何训练被监视模型本身以更易于监督的方式进行推理。代码:https://github.com/christopherzc/behavior-cues
引用
@article{arxiv.2605.07021,
title = {Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight},
author = {Christopher Z. Cui and Taylor W. Killian and Prithviraj Ammanabrolu},
journal= {arXiv preprint arXiv:2605.07021},
year = {2026}
}