论从数据学习推理的悖论
计算与语言
2022-05-26 v2 人工智能
摘要
逻辑推理在广泛的 NLP 任务中是必需的。能否端到端训练一个 BERT 模型来解决以自然语言呈现的逻辑推理问题?我们试图在一个受限问题空间中回答此问题,其中存在一组能完美模拟逻辑推理的参数。我们观察到一些看似相互矛盾的的现象:BERT 在对分布内测试样本上达到近乎完美的准确率,却无法泛化到同一问题空间上其他的数据分布。我们的研究为这一悖论提供了解释:BERT 实际上并未学习模拟正确的推理函数,而是学习了逻辑推理问题中固有存在的统计特征。我们还表明,从数据中联合移除统计特征是不可能的,这说明了一般意义上学习推理的困难。我们的结果自然扩展到其他神经模型,并揭示了学习推理与利用统计特征在 NLP 基准上取得高性能之间的根本区别。
引用
@article{arxiv.2205.11502,
title = {On the Paradox of Learning to Reason from Data},
author = {Honghua Zhang and Liunian Harold Li and Tao Meng and Kai-Wei Chang and Guy Van den Broeck},
journal= {arXiv preprint arXiv:2205.11502},
year = {2022}
}
备注
Table 1 & 2 numbers were out-dated in v1; we have updated them; the observations and conclusions remain unchanged