中文

ROM:基于流式检测与干预的实时过度思考缓解

机器学习 2026-05-12 v2 人工智能 计算与语言

摘要

大型推理模型(LRM)常常在其长链思维轨迹结束前就已达到正确解答,却继续进行冗余的验证、重复尝试或不必要的探索,这既浪费计算资源,甚至可能扰乱正确的答案。我们将这种行为定义为潜在的生产性向冗余转换,并表明其直接反映在隐藏状态中:在第一次正确解答(FCS)边界附近,晚期层表示将高效token与过度思考token分离,而基于边界置换和位置控制的基线方法则导致混沌。基于此信号,我们提出了ROM框架,这是一个模型无关的流式干预方法,通过监控冻结的LRM并在结构良好的推理边界处进行干预。反事实自我纠正(CSC)通过平衡正确与错误轨迹来增强监督,既保留有用的前FCS纠正,又仅将后FCS的延续标记为冗余。在MATH500、GSM8K、AIME25和MMLU-Pro上,ROM在Qwen3-8B和DeepSeek-R1-Distill-Qwen-32B(DS-32B)上的整体权衡均得到提升:在Qwen3-8B上,准确率从74.47%提升至74.78%,响应长度从4262缩短至3107 token;在DS-32B上,准确率从68.60%提升至68.72%,响应长度从3062缩短至2319 token。相同的FCS衍生监督可跨尺度和训练来源迁移,表明这是一种共享长链CoT边界,而非背bone特有的artifact。ROM兼容L1,在不损失准确率的情况下再减少20.9-21.6%的token。ROM也能推广到开放式MMLU-Pro(+1.56 pp,缩短35.4%),并将墙钟延迟降低46.5%。代码可在 https://github.com/SaFo-Lab/ROM 获取。

关键词

引用

@article{arxiv.2603.22016,
  title  = {ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention},
  author = {Xinyan Wang and Xiaogeng Liu and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2603.22016},
  year   = {2026}
}

备注

Code is available at https://github.com/SaFo-Lab/ROM