估计基于Transformer的NLI模型中自然逻辑特征的因果效应
计算与语言
2024-04-04 v1
摘要
对于自然语言推理问题,严格评估语义特征对语言模型预测的因果效应可能很难实现。然而,从可解释性和模型评估的角度来看,这是一种非常理想的分析形式,因此研究具有足够结构和规律性的特定推理模式以识别和量化广泛使用的模型中的系统性推理失败是有价值的。为此,我们选取了NLI任务中一个可以系统构建显式因果图的部分:在两个句子(前提和假设)中,两个相关的词/术语出现在共享上下文中。在这项工作中,我们应用因果效应估计策略来测量上下文干预的效果(其对蕴含标签的影响由语义单调性特征中介)以及对插入词对的干预效果(其对蕴含标签的影响由这些词之间的关系中介)。扩展了在不同设置下对NLP模型进行因果分析的相关工作,我们对NLI任务进行了广泛的干预研究,以调查Transformer对无关变化的鲁棒性和对重要变化的敏感性。结果有力地证实,表现出非常不同行为的模型可能观察到相似的基准准确率分数。此外,我们的方法从因果角度强化了先前怀疑的偏差,包括对向上单调上下文的偏好以及忽略否定标记的影响。
引用
@article{arxiv.2404.02622,
title = {Estimating the Causal Effects of Natural Logic Features in Transformer-Based NLI Models},
author = {Julia Rozanova and Marco Valentino and André Freitas},
journal= {arXiv preprint arXiv:2404.02622},
year = {2024}
}
备注
Accepted to LREC-COLING 2024 - Camera Ready. arXiv admin note: substantial text overlap with arXiv:2305.08572