中文

因果探测的几何概念

计算与语言 2025-03-27 v4

摘要

线性子空间假设(Bolukbasi 等,2016)指出,在语言模型的表示空间中,关于某一概念(如动词数)的所有信息都编码于一个线性子空间中。先前的工作依赖辅助分类任务来识别并评估可能支持该假设的候选子空间。我们则给出一组内在标准,刻画理想的线性概念子空间,并使我们仅利用语言模型分布即可识别该子空间。我们的信息论框架通过调和概念信息的统计概念与概念如何在表示空间中被编码的几何概念,解释了表示空间中的伪相关特征(Kumar 等,2022)。作为该分析的副产品,我们假设了一个语言模型在生成过程中可能如何利用概念的因果过程。在实证上,我们发现线性概念擦除能成功擦除我们框架下动词数以及来自餐厅评论数据集的某些复杂方面级情感概念的大部分概念信息。我们用于受控生成的因果干预表明,对于至少跨两个语言模型的一个概念,该概念子空间可用于精确操控生成词的概念取值。

关键词

引用

@article{arxiv.2307.15054,
  title  = {A Geometric Notion of Causal Probing},
  author = {Clément Guerner and Tianyu Liu and Anej Svete and Alexander Warstadt and Ryan Cotterell},
  journal= {arXiv preprint arXiv:2307.15054},
  year   = {2025}
}