所见即所在:无需文本输入的弱监督开放世界短语定位
计算机视觉与模式识别
2022-06-28 v2
摘要
仅给定一张输入图像,别无其他,我们的方法返回图像中物体的边界框以及描述这些物体的短语。这在一个开放世界范式下实现,其中输入图像中的物体可能在定位机制的训练期间未曾出现过。此外,训练在弱监督设置下进行,不提供任何边界框。为实现这一点,我们的方法结合了两个预训练网络:CLIP 图像到文本匹配分数和 BLIP 图像描述工具。训练在 COCO 图像及其描述上进行,并基于 CLIP。然后,在推理期间,使用 BLIP 对当前图像的各个区域生成假设。我们的工作推广了弱监督分割和短语定位,并在经验上证明在这两个领域均优于现有最佳方法。它还在我们工作中提出的弱监督开放世界纯视觉短语定位这一新任务上展示了非常有说服力的结果。例如,在用于基准测试短语定位的数据集上,与使用人工描述作为额外输入的方法相比,我们的方法仅导致非常轻微的性能下降。我们的代码可在 https://github.com/talshaharabany/what-is-where-by-looking 获取,在线演示可在 https://replicate.com/talshaharabany/what-is-where-by-looking 找到。
引用
@article{arxiv.2206.09358,
title = {What is Where by Looking: Weakly-Supervised Open-World Phrase-Grounding without Text Inputs},
author = {Tal Shaharabany and Yoad Tewel and Lior Wolf},
journal= {arXiv preprint arXiv:2206.09358},
year = {2022}
}