VGDiffZero:文本到图像扩散模型可作为零样本视觉定位器
计算机视觉与模式识别
2024-01-24 v4
摘要
大规模文本到图像扩散模型借助预训练获得的强视觉-语言对齐,在生成任务中展现出令人印象深刻的能力。然而,大多数视觉-语言判别任务需要于精心标注的数据集上进行大量微调以获得此类对齐,耗费大量时间与计算资源。本工作中,我们探索直接将预训练的生成式扩散模型应用于具有挑战性的判别任务——视觉定位,且无需任何微调和额外训练数据集。具体而言,我们提出VGDiffZero,一个基于文本到图像扩散模型的简单而有效的零样本视觉定位框架。我们还设计了一种综合考虑每个孤立候选框全局与局部上下文的全面区域打分方法。在RefCOCO、RefCOCO+和RefCOCOg上的大量实验表明,VGDiffZero在零样本视觉定位上取得了强劲性能。我们的代码可在 https://github.com/xuyang-liu16/VGDiffZero 获取。
引用
@article{arxiv.2309.01141,
title = {VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders},
author = {Xuyang Liu and Siteng Huang and Yachen Kang and Honggang Chen and Donglin Wang},
journal= {arXiv preprint arXiv:2309.01141},
year = {2024}
}
备注
Accepted by ICASSP 2024