Computer Vision and Pattern Recognition · Computer Science
Paparazzi: A Deep Dive into the Capabilities of Language and Vision Models for Grounding Viewpoint Descriptions
Henrik Voigt, Jan Hombeck, Monique Meuschke, Kai Lawonn +1
2023-02-22
Computer Vision and Pattern Recognition · Computer Science
Parts of Speech-Grounded Subspaces in Vision-Language Models
James Oldfield, Christos Tzelepis, Yannis Panagakis, Mihalis A. Nicolaou +1
2023-11-14
Computer Vision and Pattern Recognition · Computer Science
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw +5
2025-11-25
Computer Vision and Pattern Recognition · Computer Science
CLIP-Guided Vision-Language Pre-training for Question Answering in 3D Scenes
Maria Parelli, Alexandros Delitzas, Nikolas Hars, Georgios Vlassis +3
2023-04-14
Computer Vision and Pattern Recognition · Computer Science
Cross-Modal Concept Learning and Inference for Vision-Language Models
Yi Zhang, Ce Zhang, Yushun Tang, Zhihai He
2023-07-31
Computer Vision and Pattern Recognition · Computer Science
VisualBERT: A Simple and Performant Baseline for Vision and Language
Liunian Harold Li, Mark Yatskar, Da Yin, Cho-Jui Hsieh +1
2019-08-12
Computer Vision and Pattern Recognition · Computer Science
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
Zhuowan Li, Cihang Xie, Benjamin Van Durme, Alan Yuille
2024-01-31
Information Retrieval · Computer Science
Can Argus Judge Them All? Comparing VLMs Across Domains
Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir +4
2025-07-03
Computation and Language · Computer Science
The Scenario Refiner: Grounding subjects in images at the morphological level
Claudia Tagliaferri, Sofia Axioti, Albert Gatt, Denis Paperno
2023-09-21
Computation and Language · Computer Science
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
Reza Esfandiarpoor, Cristina Menghini, Stephen H. Bach
2024-12-06
Computer Vision and Pattern Recognition · Computer Science
Generalizable Prompt Learning of CLIP: A Brief Overview
Fangming Cui, Yonggang Zhang, Xuan Wang, Xule Wang +1
2025-05-27
Computer Vision and Pattern Recognition · Computer Science
Will It Zero-Shot?: Predicting Zero-Shot Classification Performance For Arbitrary Queries
Kevin Robbins, Xiaotong Liu, Yu Wu, Le Sun +3
2026-03-26
Computer Vision and Pattern Recognition · Computer Science
Object-centric Binding in Contrastive Language-Image Pretraining
Rim Assouel, Pietro Astolfi, Florian Bordes, Michal Drozdzal +1
2025-02-21
Computer Vision and Pattern Recognition · Computer Science
Vision language models are unreliable at trivial spatial cognition
Sangeet Khemlani, Tyler Tran, Nathaniel Gyory, Anthony M. Harrison +5
2025-04-23
Machine Learning · Computer Science
An Introduction to Vision-Language Modeling
Florian Bordes, Richard Yuanzhe Pang, Anurag Ajay, Alexander C. Li +37
2024-05-28
Computer Vision and Pattern Recognition · Computer Science
VT-CLIP: Enhancing Vision-Language Models with Visual-guided Texts
Longtian Qiu, Renrui Zhang, Ziyu Guo, Ziyao Zeng +3
2023-08-11
Computer Vision and Pattern Recognition · Computer Science
Can We Talk Models Into Seeing the World Differently?
Paul Gavrikov, Jovita Lukasik, Steffen Jung, Robert Geirhos +3
2025-03-07
Computation and Language · Computer Science
On the Difference of BERT-style and CLIP-style Text Encoders
Zhihong Chen, Guiming Hardy Chen, Shizhe Diao, Xiang Wan +1
2023-06-07
Computer Vision and Pattern Recognition · Computer Science
Image Recognition with Vision and Language Embeddings of VLMs
Illia Volkov, Nikita Kisel, Klara Janouskova, Jiri Matas
2025-09-12
Computer Vision and Pattern Recognition · Computer Science
Seeing past words: Testing the cross-modal capabilities of pretrained V&L models on counting tasks
Letitia Parcalabescu, Albert Gatt, Anette Frank, Iacer Calixto
2021-06-18