利用混合容量集成学习建模并忽略数据集偏差
机器学习
2020-11-10 v1 计算与语言
计算机视觉与模式识别
摘要
许多数据集已被证明包含由数据收集过程中的特殊性所产生的偶然相关性。例如,如果几乎所有矛盾句都包含“not”一词,那么句子蕴含数据集就可能存在虚假的词类相关性;如果狗总是在室内,那么图像识别数据集就可能存在明显的物体-背景相关性。在本文中,我们提出一种能够自动检测并忽略这类数据集特定模式的方法,我们称之为数据集偏差。我们的方法在一个集成中训练一个低容量模型与一个高容量模型。在训练期间,低容量模型学习捕获相对浅层的相关性,我们假定这些相关性很可能反映数据集偏差。这使得高容量模型能够专注于应当更好泛化的模式。我们通过引入一种使模型条件独立的新方法来确保它们学习非重叠的方法。重要的是,我们的方法不需要事先知道偏差。我们在合成数据集以及四个构建用于惩罚利用已知偏差的模型的数据集上评估性能,这些数据集涉及文本蕴含、视觉问答和图像识别任务。我们在所有设定中均显示出改进,包括在视觉问答数据集上获得 10 个百分点的提升。
引用
@article{arxiv.2011.03856,
title = {Learning to Model and Ignore Dataset Bias with Mixed Capacity Ensembles},
author = {Christopher Clark and Mark Yatskar and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2011.03856},
year = {2020}
}
备注
In EMNLP Findings