面向多模态大语言模型的测试时预热
机器学习
2025-11-07 v2 人工智能
摘要
多模态大语言模型(MLLMs)在文本与图像交叉领域的复杂推理方面前景广阔,但它们尚未完全实现这一潜力。MLLMs 通常集成了一个 LLM、一个视觉编码器以及一个将视觉编码器的嵌入映射到 LLM 文本嵌入空间的连接器。尽管每个组件都在包含数十亿样本的海量数据集上进行了预训练,但整个多模态模型通常仅在数千(或数百万)个样本上进行训练,这可能导致其在复杂推理任务上表现不佳。为解决这些不足,我们提出了一种测试时预热方法,该方法不依赖大量标注数据集进行微调,而是利用来自弱监督辅助任务的数据,针对每个测试实例对 MLLM 进行自适应调整。通过我们的方法,我们观察到 Llama-Vision-Instruct 模型在 MMMU 上的相对性能提升了 4.03%,在 VQA-Rad 上提升了 5.28%,在 GQA 上提升了 1.63%。我们的方法表明,在推理前进行“预热”可以增强 MLLMs 在多种推理任务中的鲁棒性。
引用
@article{arxiv.2509.10641,
title = {Test-Time Warmup for Multimodal Large Language Models},
author = {Nikita Rajaneesh and Thomas Zollo and Richard Zemel},
journal= {arXiv preprint arXiv:2509.10641},
year = {2025}
}