探索视觉语言组合性与识别的谱系
计算机视觉与模式识别
2024-06-14 v1 人工智能
机器学习
摘要
视觉语言模型 (VLMs) 如 CLIP 在零样态识别方面展现出惊人的能力,但在视觉语言组合性方面面临挑战,尤其是语言理解和细粒度图像文本对齐方面。本文探讨了组合性与识别之间这一复杂关系——这是 VLM 能力的两个关键方面。我们对现有 VLMs 进行了全面评估,涵盖旨在提升识别能力的预训练方法以及旨在改善组合性的微调方法。我们的评估使用 12 个组合性基准测试,以及 21 个零样态分类和两个检索基准进行识别。通过分析 274 个 CLIP 模型检查点,我们揭示了组合性理解与识别准确率之间出现的模式与权衡。这一发现最终需要致力于开发提升两者能力的模型,以及精细化组合性基准测试的制定。我们将评估框架开源于 https://github.com/ytaek-oh/vl_compo。
引用
@article{arxiv.2406.09388,
title = {Exploring the Spectrum of Visio-Linguistic Compositionality and Recognition},
author = {Youngtaek Oh and Pyunghwan Ahn and Jinhyung Kim and Gwangmo Song and Soonyoung Lee and In So Kweon and Junmo Kim},
journal= {arXiv preprint arXiv:2406.09388},
year = {2024}
}
备注
Accepted to CVPRW 2024 on 'What is Next in Multimodal Foundation Models?'. Code: https://github.com/ytaek-oh/vl_compo