语义敏感性与不一致预测:衡量自然语言推理模型的脆弱性
计算与语言
2024-02-01 v2 人工智能
计算机与社会
机器学习
摘要
近期对基于 Transformer 的自然语言理解(NLU)模型涌现能力的研究表明,它们对词汇和组合语义有一定的理解。我们提供的证据表明,这些说法应持保留态度:我们发现最先进的自然语言推理(NLI)模型对微小的、保留语义的表面形式变化敏感,这导致推理过程中出现大量不一致的模型决策。值得注意的是,这种行为不同于对组合语义的有效和深入理解,然而在标准基准上评估模型准确率时,或在探测句法、单调和逻辑稳健推理时,这种行为都不会出现。我们提出一个新的框架来衡量语义敏感性的程度。为此,我们在包含微小、保留语义的表面形式输入噪声的对抗生成示例上评估 NLI 模型。这是通过条件文本生成实现的,其明确条件是 NLI 模型将原始输入和对抗输入之间的关系预测为对称等价蕴含。我们系统地研究了该现象在 NLI 模型上的影响,涵盖域内和域外设置。我们的实验表明,语义敏感性导致域内和域外设置下的平均性能分别下降 12.92% 和 23.71%。我们进一步进行了消融研究,分析了该现象在不同模型、数据集和推理变体中的表现,并表明语义敏感性可能导致模型预测中的重大不一致。
引用
@article{arxiv.2401.14440,
title = {Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI Models},
author = {Erik Arakelyan and Zhaoqi Liu and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2401.14440},
year = {2024}
}
备注
EACL 2024