探测多模态大语言模型的全局与局部语义表示
计算与语言
2024-11-22 v3 人工智能
摘要
多模态大语言模型(MLLM)的进步极大地加速了理解集成文本和图像的应用开发。近期工作利用图像-标题数据集训练MLLM,在图像到文本任务上取得了最先进性能。然而,很少有研究探索MLLM的哪些层对全局图像信息贡献最大,而全局信息在多模态理解和生成中起着至关重要的作用。本研究发现,模型的中间层能够编码更多全局语义信息,其表示向量在视觉-语言蕴含任务上表现更好,而非最顶层。我们进一步通过物体识别任务探测模型的局部语义表示。发现最顶层可能过度关注局部信息,导致编码全局信息的能力下降。我们的代码和数据通过https://github.com/kobayashikanna01/probing_MLLM_rep发布。
引用
@article{arxiv.2402.17304,
title = {Probing Multimodal Large Language Models for Global and Local Semantic Representations},
author = {Mingxu Tao and Quzhe Huang and Kun Xu and Liwei Chen and Yansong Feng and Dongyan Zhao},
journal= {arXiv preprint arXiv:2402.17304},
year = {2024}
}
备注
Accepted by LREC-COLING 2024 as a short paper. ACL Anthology URL: [https://aclanthology.org/2024.lrec-main.1142/]