SCoOP:面向多 Vision-Language 模型系统的语义一致意见池化不确定性量化
人工智能
2026-05-29 v3 多智能体系统
摘要
组合多个视觉语言模型(VLM)可以增强多模态推理和鲁棒性,但聚合异构模型的输出会放大不确定性并增加幻觉风险。我们提出 SCoOP(语义一致意见池化),这是一种针对多 VLM 系统的训练免费不确定性量化(UQ)框架,通过不确定性加权线性意见池化实现。核心思想是将每个 VLM 视为概率性"专家",进行多次抽样,将其输出映射到统一空间,聚合其意见,并产生系统级不确定性分数。与针对单个模型的先前 UQ方法不同,SCoOP 显式测量跨多个 VLM 的集体、系统级不确定性,从而实现对高不确定性样本的有效幻觉检测和中止。 在 ScienceQA 上,SCoOP 实现了 0.866 的 AUROC 用于幻觉检测,优于基线(0.732-0.757)约 10-13%。对于中止,达到 0.907 的 AURAC,超越基线(0.818-0.840)7-9%。尽管如此,SCoOP 仅引入次微秒级的聚合开销,相对于基线而言微不足道,这也远低于典型 VLM 推理时间(约为数秒)。这些结果表明,SCoOP 提供了一种高效且原则化的不确定性感知聚合机制,推动了多模态 AI 系统的可靠性。我们的代码已公开于 https://github.com/chungenyu6/SCoOP。
引用
@article{arxiv.2603.23853,
title = {SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vision-Language Model Systems},
author = {Chung-En Johnny Yu and Brian Jalaian and Nathaniel D. Bastian},
journal= {arXiv preprint arXiv:2603.23853},
year = {2026}
}
备注
Accepted to ICLR 2026 Workshop on Agentic AI in the Wild: From Hallucinations to Reliable Autonomy