分析 NLI 模型的组合性敏感度
计算与语言
2018-11-20 v1 人工智能
摘要
自然语言推理(NLI)的成功应要求模型理解词汇与组合语义。然而,通过对抗评估,我们发现若干具有不同架构的最先进模型过度依赖前者而未能利用后者。进一步,这种对组合性的无感知并未通过当前数据集上的标准评估反映出来。我们表明,在现有模型中移除 RNN 或在训练时打乱输入词并不会引起大的性能损失,尽管组合信息被显式移除。因此,我们提出一种组合性敏感度测试设置,该设置在现有数据集的自然样本上分析模型,这些样本无法仅通过词汇特征解决(即词袋模型对某一错误标签给出高概率),从而揭示模型实际的组合性意识。我们表明该设置不仅凸显了当前 NLI 模型有限的组合能力,还基于设计区分了模型性能,例如将浅层词袋模型与更深、基于语言学的树结构模型分离。我们的评估设置是一项重要的分析工具:补充当前已有的对抗与语言学驱动的诊断评估,并揭示未来工作中评估模型组合性理解的机会。
引用
@article{arxiv.1811.07033,
title = {Analyzing Compositionality-Sensitivity of NLI Models},
author = {Yixin Nie and Yicheng Wang and Mohit Bansal},
journal= {arXiv preprint arXiv:1811.07033},
year = {2018}
}
备注
AAAI 2019