中文

在模型完成思考前预测对齐性:面向监控不一致推理模型的探索

计算与语言 2025-10-08 v2 人工智能 机器学习

摘要

推理语言模型通过生成长链思维(CoTs)提升复杂任务性能,但在对抗性场景下也可能增加有害输出。本文探讨能否利用长CoTs实现预测性安全监控:推理轨迹是否提供最终响应对齐性的早期信号,从而实现及时干预。我们评估多种监控方法,包括基于CoT文本或激活值的技术,涵盖高性能大型语言模型、精调分类器及人类。首先发现,基于CoT激活值的简单线性探针在预测最终响应是否安全方面显著优于所有基于文本的基线,F1分数平均提升13分。CoT文本常不忠实且误导,而模型潜在表示提供更可靠的预测信号。探针可应用于响应生成前的早期CoT片段,表明对齐信号在推理完成前即已显现。错误分析揭示,文本分类器与线性探针间的性能差距主要源自我们称为“表演性CoT”的子集——即推理过程与最终响应持续矛盾。我们的发现跨模型规模、家族及安全基准测试均成立,表明轻量级探针可实现生成期间的实时安全监控与早期干预。

关键词

引用

@article{arxiv.2507.12428,
  title  = {Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models},
  author = {Yik Siu Chan and Zheng-Xin Yong and Stephen H. Bach},
  journal= {arXiv preprint arXiv:2507.12428},
  year   = {2025}
}