中文

内部因果机制可预测语言模型的外部分布行为

机器学习 2025-11-12 v2 人工智能 计算与语言 机器学习

摘要

可解释性研究提供了多种识别神经网络内部抽象机制的技术方法。这些技术能否用于预测模型在外部分布示例上的行为?本文给出肯定回答。通过多样化的语言建模任务——包括符号操作、知识检索和指令遵循——我们表明,正确性预测的最稳健特征是那些在模型行为中发挥显著因果作用的特征。具体而言,我们提出两种方法,利用因果机制预测模型输出的正确性:反事实模拟(检查关键因果变量是否被实现)和值探测(使用这些变量的值进行预测)。两种方法在分布内和分布外均实现高AUC-ROC,其中在分布外设置中,预测模型行为尤为关键。我们的工作因此突显了对语言模型内部因果分析的一种新型且重大的应用。

关键词

引用

@article{arxiv.2505.11770,
  title  = {Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors},
  author = {Jing Huang and Junyi Tao and Thomas Icard and Diyi Yang and Christopher Potts},
  journal= {arXiv preprint arXiv:2505.11770},
  year   = {2025}
}

备注

ICML 2025