中文

ReCLIP:一种强零样本指代表达理解基线

计算机视觉与模式识别 2022-05-04 v2 计算与语言

摘要

为新视觉域训练指代表达理解(ReC)模型需收集该域图像的指代表达,以及潜在的相应边界框。尽管大规模预训练模型跨域对图像分类有用,其能否以零样本方式应用于 ReC 等更复杂任务仍不明晰。我们提出 ReCLIP,一个简单但强力的零样本基线,将 SOTA 大规模模型 CLIP 改造用于 ReC。受 ReC 与 CLIP 对比预训练目标紧密联系的启发,ReCLIP 的第一组件为一种区域打分方法,通过裁剪与模糊隔离目标提议,并将其送入 CLIP。然而,通过在合成数据集上的受控实验,我们发现 CLIP 在现成状态下基本无法进行空间推理。因此,ReCLIP 的第二组件为一种处理若干类空间关系的空间关系解析器。在 RefCOCOg 上,我们将先前工作的零样本基线与监督模型间差距缩小多达 29%;在 RefGTA(电子游戏图像)上,ReCLIP 相对基于真实图像训练的监督 ReC 模型的相对提升为 8%。

关键词

引用

@article{arxiv.2204.05991,
  title  = {ReCLIP: A Strong Zero-Shot Baseline for Referring Expression Comprehension},
  author = {Sanjay Subramanian and William Merrill and Trevor Darrell and Matt Gardner and Sameer Singh and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2204.05991},
  year   = {2022}
}

备注

ACL 2022