基于不可一致性调整语义体积的多模态大语言模型不确定性量化
人工智能
2026-03-02 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
尽管具备强大的能力,多模态大语言模型(MLLMs)仍可能产生符合情境但错误的输出,从而限制其可靠部署。准确的不确定性度量可用于将不可靠查询升级至人类专家或更大模型以提升性能。然而,现有的不确定性度量在实际应用中存在诸多限制,如仅针对特定模态、依赖外部工具或计算成本高昂。我们引入了 UMPIRE,这是一个无需训练的多模态大语言模型不确定性量化框架,能够高效地跨越各种输入和输出模态且无需外部工具,仅依赖模型自身的内部模态特征。UMPIRE 计算抽样 MLLM 响应的不可一致性调整语义体积,以有效捕捉样本的全局语义多样性以及基于内部模型置信度的局部不一致性。我们提出了针对 MLLMs 的不确定性需求,并提供理论分析以阐释 UMPIRE 设计的动机。大量实验表明,UMPIRE 在图像、音频和视频文本基准测试中,包括对抗性和超分布设置下,均显著优于基线度量标准在错误检测和不确定性校准方面。我们还展示了 UMPIRE 对非文本输出任务的泛化能力,包括图像和音频生成。
引用
@article{arxiv.2602.24195,
title = {Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume},
author = {Gregory Kang Ruey Lau and Hieu Dao and Nicole Kan Hui Lin and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2602.24195},
year = {2026}
}
备注
Earlier versions presented at ICLR 2025 QUESTION workshop and ICML 2025 R2-FM workshop