相似的 BERT 模型并不共同泛化:测试集表现相近的模型间泛化存在巨大差异
计算与语言
2020-11-17 v2
摘要
如果同一神经网络架构在同一数据集上多次训练,它是否会在不同次运行间做出相似的语言学泛化?为研究此问题,我们在多体裁自然语言推理(MNLI)数据集上微调了 100 个 BERT 实例,并在 HANS 数据集上评估它们,该数据集评测自然语言推理中的句法泛化。在 MNLI 开发集上,所有实例的行为惊人地一致,准确率介于 83.6% 与 84.8% 之间。形成鲜明对比的是,相同模型在其泛化性能上差异巨大。例如,在主语-宾语互换的简单情形(如判定“医生拜访了律师”不蕴含“律师拜访了医生”)上,准确率从 0.00% 到 66.2% 不等。此种变异可能源于许多对神经网络等低偏置学习器同样有吸引力的局部极小值的存在;因此,减小变异性可能需要具有更强归纳偏置的模型。
引用
@article{arxiv.1911.02969,
title = {BERTs of a feather do not generalize together: Large variability in generalization across models with similar test set performance},
author = {R. Thomas McCoy and Junghyun Min and Tal Linzen},
journal= {arXiv preprint arXiv:1911.02969},
year = {2020}
}
备注
11 pages, 7 figures; accepted to the 2020 BlackboxNLP workshop