不确定性-o:面向大型多模态模型的统一模型无关框架
计算机视觉与模式识别
2025-06-10 v1 机器学习
摘要
大型多模态模型 (LMM) 利用不同模态的互补性,通常被认为比纯语言大模型 (LLM) 更健壮;然而,LMM 是否了解自身的局限性呢?仍有三个关键问题尚未解决:(1) 如何统一评估不同 LMM 的不确定性,(2) 如何引导 LMM 显示其不确定性,(3) 如何为下游任务量化不确定性。为此,我们引入 Uncertainty-o:(1) 一个面向 LMM 的模型无关框架,无论其模态、架构或能力如何,都能揭示 LMM 的不确定性;(2) 对多模态提示扰动的经验性探索,以揭示 LMM 的不确定性,提供洞见与发现;(3) 推导多模态语义不确定性的公式,使我们能够从多模态响应中量化不确定性。跨 18 个基准测试(涵盖 various 模态)和 10 个 LMM(包括开源和闭源模型)的实验表明,Uncertainty-o 能可靠地估计 LMM 的不确定性,从而提升下游任务,如幻觉检测、幻觉缓解和不确定性感知的链式思考推理。
引用
@article{arxiv.2506.07575,
title = {Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models},
author = {Ruiyang Zhang and Hu Zhang and Hao Fei and Zhedong Zheng},
journal= {arXiv preprint arXiv:2506.07575},
year = {2025}
}
备注
Project page: https://uncertainty-o.github.io/