中文

从潜在信号到反思行为:追踪 R1 风格大语言模型中元认知激活轨迹

计算与语言 2026-02-06 v2

摘要

R1 风格的大语言模型因其自我反思能力而受到广泛关注,但其内部机制仍不明朗。为弥合这一差距,我们聚焦于反思行为的起始点,追踪其各层的激活轨迹。利用 logit 镜头读取 token 级别的语义,我们发现其结构化的进程:(i) 潜在控制层,编码思考预算语义的近似线性方向;(ii) 语义枢纽层,话语级别的线索(包括转折点和总结线索)逐渐显现并占据主要概率质量;(iii) 行为显现层,反思行为 token 的概率开始上升直至成为高度被采样的可能性。此外,我们的定向干预揭示了这些阶段之间的因果链:提示级别的语义调制了沿潜在控制方向激活的投影,从而在语义枢纽层中诱发转折点与总结线索之间的竞争,进而调节行为显现层中反思行为 token 采样概率。总体而言,我们的发现表明一种类似人类的元认知过程——从潜在监控,到话语层次的调节,再到最终的显性自我反思。我们的分析代码可在 https://github.com/DYR1/S3-CoT 查看。

关键词

引用

@article{arxiv.2602.01999,
  title  = {From Latent Signals to Reflection Behavior: Tracing Meta-Cognitive Activation Trajectory in R1-Style LLMs},
  author = {Yanrui Du and Yibo Gao and Sendong Zhao and Jiayun Li and Haochun Wang and Qika Lin and Kai He and Bing Qin and Mengling Feng},
  journal= {arXiv preprint arXiv:2602.01999},
  year   = {2026}
}