FESTA:面向多模态大语言模型信任评估的功能等效采样
人工智能
2026-02-02 v4 计算与语言
机器学习
摘要
由于多模态输入范式的多样性,对多模态大语言模型(MLLMs)生成的预测进行准确的信任评估具有挑战性,而这种评估可以实现选择性预测并提高用户信心。我们提出了面向信任评估的功能等效采样(FESTA),这是一种针对MLLMs的多模态输入采样技术,它基于等效和互补的输入采样生成不确定性度量。所提出的用于不确定性量化的任务保持采样方法扩展了输入空间,以探测模型的一致性(通过等效样本)和敏感性(通过互补样本)。FESTA仅使用模型的输入-输出访问(黑盒),并且不需要真实标签(无监督)。实验在多种现成的多模态大语言模型上进行,涉及视觉和音频推理任务。基于检测错误预测的接收者操作特征曲线下面积(AUROC)指标,所提出的FESTA不确定性估计在选择性预测性能上取得了显著提升(视觉大语言模型相对提升33.3%,音频大语言模型相对提升29.6%)。代码实现已开源。
引用
@article{arxiv.2509.16648,
title = {FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs},
author = {Debarpan Bhattacharya and Apoorva Kulkarni and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2509.16648},
year = {2026}
}
备注
Accepted in the Findings of EMNLP, 2025