勿想当然看待前提:缓解自然语言推理中的伪特征
计算与语言
2019-07-11 v1
摘要
自然语言推理(NLI)数据集常包含仅依赖假设的偏置——即伪特征(artifacts),使模型无需学习前提是否蕴含假设即可获得非平凡性能。我们提出两种概率方法,以构建对这类偏置更鲁棒且能更好跨数据集迁移的模型。与标准 NLI 方法不同,我们的方法预测给定假设与 NLI 标签下前提的概率,从而阻止模型忽略前提。我们在合成与已有 NLI 数据集上评估了我们的方法:在含偏置的数据集上训练,并在不含(或含不同)仅假设偏置的数据集上测试。结果表明,这些方法可使 NLI 模型对数据集特定伪特征更鲁棒,在 12 个 NLI 数据集中的 9 个上比基线架构迁移更好。此外,我们提供了对方法与所述 NLI 数据集中已知偏置相互作用的广泛分析,以及鼓励模型忽略偏置与在目标数据集上微调的影响。
引用
@article{arxiv.1907.04380,
title = {Don't Take the Premise for Granted: Mitigating Artifacts in Natural Language Inference},
author = {Yonatan Belinkov and Adam Poliak and Stuart M. Shieber and Benjamin Van Durme and Alexander M. Rush},
journal= {arXiv preprint arXiv:1907.04380},
year = {2019}
}
备注
ACL 2019