中文

潜在因果探测:对基于因果模型的探测的形式化视角

计算与语言 2024-08-01 v2 人工智能

摘要

随着语言模型在多种 NLP 任务上取得日益增长的性能,探测分类器已成为理解其内部工作机制中不可或缺的技术。典型的设置包括(1)定义由带标签文本数据集构成的辅助任务,然后(2)监督小型分类器从预训练语言模型在处理该数据集时的表示中预测标签。高探测准确率被解释为语言模型作为其原始预训练目标的无监督副产品学习执行该辅助任务的证据。尽管探测技术用途广泛,但探测实验的稳健设计与分析仍然是一个挑战。我们发展了一种基于结构因果模型 (SCM) 的形式化视角来进行探测。具体来说,给定解释训练期间观察到的标记分布的 SCM,我们将核心假设框架为:该语言模型是否学习了表示 SCM 的潜在变量。我们在日益增长的性能背景下,对语言模型在合成网格世界导航任务中的表现进行了扩展,利用精确的因果结构模型可使我们从探测实验结果中获得强有力的推断。我们的技术为语言模型诱导文本潜在概念的能力提供了稳健的实证证据。

关键词

引用

@article{arxiv.2407.13765,
  title  = {Latent Causal Probing: A Formal Perspective on Probing with Causal Models of Data},
  author = {Charles Jin and Martin Rinard},
  journal= {arXiv preprint arXiv:2407.13765},
  year   = {2024}
}

备注

COLM 2024