COLA:一种组合式文本到图像检索基准
计算机视觉与模式识别
2023-11-06 v3
摘要
组合推理是人类视觉智能的标志。然而,尽管大型视觉-语言模型规模庞大,它们仍难以通过将对象与其属性组合来表示简单的组合。为衡量这种组合能力的缺失,我们设计了 Cola,一个将具有属性的局部化对象进行组合的文本到图像检索基准(Compose Objects Localized with Attributes)。要解决 Cola,模型必须检索具有正确属性和对象配置的图像,并避免选择具有相同对象和属性但配置错误的干扰图像。Cola 包含约 1.2k 个组合查询,涉及 168 个对象和 197 个属性,覆盖约 30K 张图像。我们的人工评估发现 Cola 准确率为 83.33%,与当代组合性基准相似。以 Cola 为测试平台,我们探索经验建模设计,使预训练视觉-语言模型适应组合推理。我们在两个开创性视觉-语言模型上探索了 6 种适应策略,使用以组合性为中心的测试基准——Cola 和 CREPE。我们发现最优适应策略是训练一个多模态注意力层,联合注意力于冻结的预训练图像和语言特征。令人惊讶的是,在 CLIP 上训练多模态层优于微调已预训练多模态层的更大的 FLAVA 模型。此外,我们的适应策略将 CLIP 和 FLAVA 提升到可比水平,表明使用对比属性-对象数据训练多模态层是关键,而非使用预训练的多模态层。最后,我们展示 Cola 比密切相关的当代基准 CREPE 更难,因为 CREPE 上无需多模态层的简单微调策略已足够,而在 Cola 上则不行。然而,我们仍看到最佳适应与人类准确率之间存在显著差距,表明仍有相当的研究空间。
引用
@article{arxiv.2305.03689,
title = {COLA: A Benchmark for Compositional Text-to-image Retrieval},
author = {Arijit Ray and Filip Radenovic and Abhimanyu Dubey and Bryan A. Plummer and Ranjay Krishna and Kate Saenko},
journal= {arXiv preprint arXiv:2305.03689},
year = {2023}
}
备注
Accepted to NeurIPS 2023. Webpage: https://cs-people.bu.edu/array/research/cola/