女性也滑雪:克服图像描述模型中的偏差
计算机视觉与模式识别
2019-03-15 v4
摘要
已知大多数机器学习方法会捕获并利用训练数据中的偏差。虽然某些偏差对学习是有益的,但其他偏差是有害的。具体而言,图像描述模型倾向于夸大训练数据中存在的偏差(例如,如果一个词在60%的训练句子中出现,它可能在测试时在70%的句子中被预测)。这会导致在期望或要求无偏描述的领域中,由于过度依赖学习到的先验和图像上下文而产生错误的描述。在本工作中,我们研究了基于人物外观或图像上下文生成特定性别的描述词(例如man, woman)。我们引入了一个新的Equalizer模型,当场景中性别证据被遮挡时,该模型确保相等的性别概率;当存在性别证据时,则做出自信的预测。由此产生的模型被迫去观察人本身,而不是利用上下文线索来进行特定性别的预测。构成我们模型的损失函数,即外观混淆损失和置信损失,是通用的,可以添加到任何描述模型中,以减轻描述数据集中不良偏差的影响。与先前的工作相比,我们提出的模型在描述包含人物的图像并提及他们的性别时具有更低的错误率,并且更接近包含女性的句子与包含男性的句子的真实比例。我们还表明,与其他方法不同,我们的模型在预测性别时确实更频繁地关注人本身。
引用
@article{arxiv.1803.09797,
title = {Women also Snowboard: Overcoming Bias in Captioning Models},
author = {Kaylee Burns and Lisa Anne Hendricks and Kate Saenko and Trevor Darrell and Anna Rohrbach},
journal= {arXiv preprint arXiv:1803.09797},
year = {2019}
}
备注
22 pages, 6 figures, Burns and Hendricks contributed equally