中文

MonitorBench:用于评估大型语言模型链式思维可监控性的综合基准

人工智能 2026-04-03 v2

摘要

大型语言模型(LLMs)可生成的思维链(CoTs)未必始终与最终输出因果相关。当发生此类不匹配时,CoT便不再忠实地反映驱动模型行为的实际原因(即决策关键因素),导致CoT可监控性问题。然而,目前缺乏用于全面评估CoT可监控性的完整且开源基准。为填补此空白,本文提出MonitorBench,用于评估LLMs中CoT可监控性的系统基准。MonitorBench提供:(1)跨19个任务、7个类别的1,514个测试实例,精心设计决策关键因素,以刻画CoT可用于监控驱动LLM行为的因素时机;以及(2)两个压力测试设置,以量化CoT可监控性可被削弱的程度。广泛实验表明,决策关键因素若塑造中间推理过程而仅影响最终答案,CoT可监控性更高。较强大的LLMs倾向于表现出较低的可监控性。所有评估的LLMs在压力测试下均可有意识地降低可监控性,在某些不要求对决策关键因素进行结构化推理的任务中,可监控性可下降最高30%。总体而言,MonitorBench为进一步研究评估未来LLMs、 study高级压力测试可监控性技术、以及开发新型监控方法提供了基础。代码已公开于https://github.com/ASTRAL-Group/MonitorBench。

关键词

引用

@article{arxiv.2603.28590,
  title  = {MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models},
  author = {Han Wang and Yifan Sun and Brian Ko and Mann Talati and Jiawen Gong and Zimeng Li and Naicheng Yu and Xucheng Yu and Wei Shen and Vedant Jolly and Huan Zhang},
  journal= {arXiv preprint arXiv:2603.28590},
  year   = {2026}
}

备注

57 pages