通过信息论分析与改进链路思维可观测性
机器学习
2026-02-23 v1 人工智能
计算与语言
信息论
math.IT
摘要
链路思维 (CoT) 监视器是基于大型语言模型的系统,用于分析推理痕迹以检测输出可能呈现感兴趣属性的情况,例如代码生成期间的测试作弊行为。在本文中,我们使用信息论分析表明,CoT 与输出之间的非零互信息是 CoT 可观测性的必要但非充分条件。我们识别出两种近似误差源可能削弱 CoT 监视器在实际中的性能:信息差,衡量监视器能从 CoT 中提取的可用信息的程度;和引导误差,衡量监视器对最优监控函数的近似程度。我们进一步演示了可以通过针对性训练目标系统地改善 CoT 可观测性。为此,我们提出了两种互补方法:(a) 一种基于 oracle 的方法,直接奖励被监控模型产生能够最大化监控器准确性的 CoT;以及 (b) 更实用的、无标签的方法,通过最大化输出与 CoT 之间的条件互信息来实现。我们在多个不同环境中展示,这两种方法显著提高了监控准确性,同时防止 CoT 退化,即使在针对监控器进行训练时亦如此,从而缓解了当任务奖励未能完美指定时的奖励作弊问题。
引用
@article{arxiv.2602.18297,
title = {Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory},
author = {Usman Anwar and Tim Bakker and Dana Kianfar and Cristina Pinneri and Christos Louizos},
journal= {arXiv preprint arXiv:2602.18297},
year = {2026}
}
备注
First two authors contributed equally