通过解码器专一模型优化视觉语言交互
计算机视觉与模式识别
2024-12-17 v1
摘要
视觉语言模型(VLMs)已成为多模态任务的关键使能器,但其依赖于独立的视觉编码器带来了效率、可扩展性和模态对齐方面的挑战。为此,我们提出了 MUDAIF(Multimodal Unified Decoder with Adaptive Input Fusion),一种解码器专一的视觉语言模型,通过新颖的视觉-标记适配器(VTA)和自适应共注意力机制无缝整合视觉和文本输入。通过消除视觉编码器的需求,MUDAIF实现了提高的效率、灵活性和跨模态理解能力。在由4500万张图像-文本对组成的大规模数据集上训练后,MUDAIF在多个基准测试中 consistently 超过了最先进的方法,包括VQA、图像字幕和多模态推理任务。广泛的分析和人类评估表明,MUDAIF在鲁棒性、泛化能力和实际可用性方面表现出色,确立了其作为无编码器视觉语言模型的新标准。
引用
@article{arxiv.2412.10758,
title = {Optimizing Vision-Language Interactions Through Decoder-Only Models},
author = {Kaito Tanaka and Benjamin Tan and Brian Wong},
journal= {arXiv preprint arXiv:2412.10758},
year = {2024}
}