从免训练到自适应:多模态大语言模型理解检测信息的实证洞察
计算机视觉与模式识别
2024-12-20 v3 人工智能
摘要
尽管多模态大语言模型(MLLMs)在整合文本与图像模态方面展现出令人瞩目的能力,但在准确解读细粒度视觉元素方面仍面临挑战。视觉检测模型擅长识别细粒度图像细节,促使研究者利用它们来增强多模态大语言模型。一种有效的策略是以文本格式注入检测信息,该方法已被证明简单且有效。然而,大多数研究在免训练的情况下使用此方法,自适应训练的潜力在很大程度上尚未被探索。自适应训练可以显著增强多模态大语言模型对独特输入的理解,同时过滤掉无关信息。本文探讨了一个关键问题:训练如何影响多模态大语言模型对注入的文本检测信息的理解?我们系统地实验了多种代表性模型,以评估免训练、重新训练和微调策略的效果。我们还考察了训练对多模态大语言模型原有能力的影响以及检测模型的可互换性。我们的发现表明,对预训练的多模态大语言模型进行微调以整合文本检测信息,其结果优于免训练和重新训练方法,在10个广泛认可的基准测试中性能提升了6.71%。此外,微调使得多模态大语言模型即使在更换检测模型时也能保持性能提升,表明其对格式化文本数据的理解得到了改善。我们公开了代码,以支持对视觉检测模型融合策略及增强多模态大语言模型细粒度多模态能力的进一步探索。
引用
@article{arxiv.2401.17981,
title = {From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information},
author = {Qirui Jiao and Daoyuan Chen and Yilun Huang and Yaliang Li and Ying Shen},
journal= {arXiv preprint arXiv:2401.17981},
year = {2024}
}
备注
32 pages, 22 tables, 7 figures