高维干预式探察:一项自然语言推理案例研究
计算与语言
2023-04-21 v1
摘要
探察策略已被证明可检测大语言模型(LLM)中各类语言特征的存在,特别是自然语言推理(NLI)任务“自然逻辑”片段中间层面的语义特征。在自然逻辑的情形下,中间特征与蕴涵标签之间的关系是显式已知的:因此,这为对 NLI 模型表征进行干预研究提供了成熟环境,使得更强的因果推断与对干预式探察方法的更深入批判性分析成为可能。在本工作中,我们实施新的及已有的表征层面干预,以考察这些语义特征对 NLI 分类的影响:我们进行遗忘式探察(按习得线性探察器指示移除特征)并引入记忆式探察变体(遗忘除探察器选定维度外的所有维度)。此外,我们深入探讨了这些方法的局限,并概述了某些一直模糊干预式探察研究有效性的陷阱。
引用
@article{arxiv.2304.10346,
title = {Interventional Probing in High Dimensions: An NLI Case Study},
author = {Julia Rozanova and Marco Valentino and Lucas Cordeiro and Andre Freitas},
journal= {arXiv preprint arXiv:2304.10346},
year = {2023}
}