勿走捷径:基于集成的方法以避免已知数据集偏差
计算与语言
2019-09-10 v1 计算机视觉与模式识别
机器学习
摘要
最先进的模型常常利用数据中未良好泛化至域外或对抗设置的表层模式。例如,文本蕴含模型常学到特定关键词意味着蕴含而不顾上下文,视觉问答模型则学会预测典型答案而不考虑图像中的证据。在本文中,我们展示若事先知晓此类偏差,可训练更具域偏移鲁棒性的模型。我们的方法分两阶段:我们(1)训练仅基于数据集偏差进行预测的朴素模型,并(2)将鲁棒模型作为与朴素模型集成的部分进行训练,以促使其关注数据中更可能泛化的其他模式。在五个具域外测试集的数据集上的实验表明所有设置下鲁棒性均显著提升,包括在变化先验的视觉问答数据集上提升12点以及在对抗问答测试集上提升9点。
引用
@article{arxiv.1909.03683,
title = {Don't Take the Easy Way Out: Ensemble Based Methods for Avoiding Known Dataset Biases},
author = {Christopher Clark and Mark Yatskar and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:1909.03683},
year = {2019}
}
备注
In EMNLP 2019