中文

多模态大语言模型校准与性能的深度探索

计算机视觉与模式识别 2024-12-30 v2 人工智能 计算与语言 机器学习 机器学习

摘要

多模态大语言模型(MLLM)将视觉和文本数据结合用于图像字幕生成和视觉问答等任务。对于可靠的 healthcare 和 autonomous driving 等应用,Proper uncertainty calibration至关重要且具有挑战性。本文调查了代表性MLLM,关注其在各种情景下的校准情况,包括视觉微调前后以及基础LLM的多模态训练前后。我们观察到其性能存在校准不良现象,而且在这些情境下校准差异并不显著。我们还指出了不确定性在文本和图像之间的差异以及它们的集成对整体不确定性的影响。为更好地理解MLLM的校准不良及其自我评估不确定性的能力,我们构建了IDK(I don't know)数据集,这是评估其处理未知问题的关键。我们的发现表明,MLLM倾向于给出答案而非承认不确定性,但通过适当的 prompt 调整可改善这种自我评估。最后,为了校准MLLM并增强模型可靠性,我们提出了temperature scaling和迭代 prompt 优化等技术。我们的结果为在多模态应用中实现有效和负责任的 MLLM部署提供了见解。代码和IDK数据集:https://github.com/hfutml/Calibration-MLLM

关键词

引用

@article{arxiv.2412.14660,
  title  = {Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models},
  author = {Zijun Chen and Wenbo Hu and Guande He and Zhijie Deng and Zheng Zhang and Richang Hong},
  journal= {arXiv preprint arXiv:2412.14660},
  year   = {2024}
}

备注

Accepted to COLING 2025