寻找 Waldo 需要上下文线索:对 Who's Waldo 的去偏
计算机视觉与模式识别
2022-04-01 v1 计算与语言
机器学习
摘要
我们提出了一个用于以人物为中心的视觉定位(PCVG)任务的去偏数据集,该任务由 Cui 等人(2021)在 Who's Waldo 数据集中首次提出。给定一幅图像和一个标题,PCVG 需要将标题中提到的人物姓名与指向图像中人物的边界框配对。我们发现为此任务编制的原始 Who's Waldo 数据集包含大量可通过启发式方法轻易解决的偏置样本;例如,在许多情况下,句子中的第一个名字对应于最大的边界框,或句子中名字的顺序对应于图像中严格的从左到右顺序。自然地,在这些偏置数据上训练的模型会导致对基准性能的过高估计。为强制模型因正确原因而正确,我们设计了自动化工具,通过排除所有上下文不足的样例(例如标题中无动词或含长串并列名字)来过滤并去偏原始数据集。我们的实验表明,我们的新子采样数据集偏置更少,启发式性能大幅降低,且启发式与监督方法间的差距扩大。我们还证明,在相同基准模型下,在我们的去偏训练集上训练优于在原始偏置(且更大)训练集上训练并在我们的去偏测试集上测试的结果。我们认为我们的去偏数据集为 PCVG 任务提供了更实用的可靠基准和未来发展基线。
引用
@article{arxiv.2203.16682,
title = {To Find Waldo You Need Contextual Cues: Debiasing Who's Waldo},
author = {Yiran Luo and Pratyay Banerjee and Tejas Gokhale and Yezhou Yang and Chitta Baral},
journal= {arXiv preprint arXiv:2203.16682},
year = {2022}
}
备注
Accepted at ACL 2022 (Short Paper)