ReBeCA:揭示语言模型自我反思中可解释行为层级的因果分析
计算与语言
2026-02-09 v1
摘要
尽管自我反思可以提升语言模型的可靠性,但其背后的机制仍然是不透明的,现有的分析往往提供基于相关性的见解,难以概括。为此,我们提出了 \textbf{\texttt{ReBeCA}}(self-\textbf{\texttt{Re}}flection \textbf{\texttt{Be}}havior explained through \textbf{\texttt{C}}ausal \textbf{\texttt{A}}nalysis),一个揭示控制自我反思结果的可解释行为层级的框架。通过将自我反思轨迹建模为因果图,ReBeCA 通过三阶段不变因果预测(ICP)管道来隔离真正的性能决定因素。我们确立了三个关键发现:(1)\textbf{行为层级:}模型的语义行为以层级方式影响最终的自我反思结果:直接或间接地;(2)\textbf{因果关系重要:}自我反思效果的可泛化性仅限于少数语义行为;(3)\textbf{更多并不等于更好:}看似积极的语义行为的综合,即使这些行为是直接的因果因子,也会损害自我反思的效能。ICP 基于的验证识别出稀疏的因果父节点,可实现最高达 的结构似然性提升,在任务中保持稳定,而相关性方法的模式则失败。干预研究在新数据集上确认这些因果关系在分布外 () 均成立。因此,ReBeCA 提供了一种严谨的方法,用于在自我反思动力学中消除真正的因果机制与虚假关联。
引用
@article{arxiv.2602.06373,
title = {ReBeCA: Unveiling Interpretable Behavior Hierarchy behind the Iterative Self-Reflection of Language Models with Causal Analysis},
author = {Tianqiang Yan and Sihan Shang and Yuheng Li and Song Qiu and Hao Peng and Wenjian Luo and Jue Xie and Lizhen Qu and Yuan Gao},
journal= {arXiv preprint arXiv:2602.06373},
year = {2026}
}
备注
17 pages, 3 figures