Computer Vision and Pattern Recognition · Computer Science
MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning
Constantin Eichenberg, Sidney Black, Samuel Weinbach, Letitia Parcalabescu +1
2022-10-26
Computer Vision and Pattern Recognition · Computer Science
Towards Understanding Multimodal Fine-Tuning: Spatial Features
Lachin Naghashyar, Hunar Batra, Ashkan Khakzar, Philip Torr +3
2026-02-10
Computation and Language · Computer Science
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
Yunxin Li, Xinyu Chen, Baotian Hu, Haoyuan Shi +1
2024-06-27
Computation and Language · Computer Science
Visually-Augmented Language Modeling
Weizhi Wang, Li Dong, Hao Cheng, Haoyu Song +4
2023-02-28
Computer Vision and Pattern Recognition · Computer Science
ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation
Weihan Wang, Zhen Yang, Bin Xu, Juanzi Li +1
2023-09-01
Computer Vision and Pattern Recognition · Computer Science
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
Xiangyang Wu, Liu Liu, Baosheng Yu, Jiayan Qiu +1
2025-11-14
Computer Vision and Pattern Recognition · Computer Science
VLMAE: Vision-Language Masked Autoencoder
Sunan He, Taian Guo, Tao Dai, Ruizhi Qiao +3
2022-08-22
Computer Vision and Pattern Recognition · Computer Science
Veagle: Advancements in Multimodal Representation Learning
Rajat Chawla, Arkajit Datta, Tushar Verma, Adarsh Jha +5
2024-10-29
Computer Vision and Pattern Recognition · Computer Science
VladVA: Discriminative Fine-tuning of LVLMs
Yassine Ouali, Adrian Bulat, Alexandros Xenos, Anestis Zaganidis +3
2025-05-12
Machine Learning · Computer Science
An Introduction to Vision-Language Modeling
Florian Bordes, Richard Yuanzhe Pang, Anurag Ajay, Alexander C. Li +37
2024-05-28
Machine Learning · Computer Science
ILLUME: Rationalizing Vision-Language Models through Human Interactions
Manuel Brack, Patrick Schramowski, Björn Deiseroth, Kristian Kersting
2023-06-01
Machine Learning · Computer Science
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
Mingyuan Zhang, Yue Bai, Yifan Wang, Yiyang Huang +1
2025-12-30
Computer Vision and Pattern Recognition · Computer Science
LVLM-Aided Alignment of Task-Specific Vision Models
Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner
2026-05-05
Computer Vision and Pattern Recognition · Computer Science
Multi-modal Attribute Prompting for Vision-Language Models
Xin Liu, Jiamin Wu, and Wenfei Yang, Xu Zhou +1
2024-07-12
Computer Vision and Pattern Recognition · Computer Science
Teaching VLMs to Localize Specific Objects from In-context Examples
Sivan Doveh, Nimrod Shabtay, Wei Lin, Eli Schwartz +8
2025-03-14
Computer Vision and Pattern Recognition · Computer Science
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
Hang Hua, Jing Shi, Kushal Kafle, Simon Jenni +4
2024-07-23
Computer Vision and Pattern Recognition · Computer Science
Improved Alignment of Modalities in Large Vision Language Models
Kartik Jangra, Aman Kumar Singh, Yashwani Mann, Geetanjali Rathee
2025-03-26
Computer Vision and Pattern Recognition · Computer Science
Visual Representation Alignment for Multimodal Large Language Models
Heeji Yoon, Jaewoo Jung, Junwan Kim, Hyungyu Choi +9
2025-10-13
Computer Vision and Pattern Recognition · Computer Science
DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning
Wenhao Li, Xianjing Meng, Qiangchang Wang, Zhongyi Han +2
2026-02-25
Computer Vision and Pattern Recognition · Computer Science
Right this way: Can VLMs Guide Us to See More to Answer Questions?
Li Liu, Diji Yang, Sijia Zhong, Kalyana Suma Sree Tholeti +3
2024-11-04
Machine Learning · Computer Science
Fine-Tuning Vision-Language Models for Multimodal Polymer Property Prediction
An Vuong, Minh-Hao Van, Prateek Verma, Chen Zhao +1
2025-11-11
Computer Vision and Pattern Recognition · Computer Science
Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data
Yucheng Shi, Quanzheng Li, Jin Sun, Xiang Li +1
2025-02-26