用于不确定性感知选择性预测的变分视觉问答
计算机视觉与模式识别
2026-04-23 v3 人工智能
摘要
尽管近年来在视觉问答(VQA)和视觉推理等任务上取得了显著进展,但视觉语言模型(VLMs)仍容易产生过度自信和幻觉。贝叶斯方法可以通过帮助模型选择性地进行预测来提高可靠性,即仅在模型足够自信时作出响应。然而,这些方法对于大型模型而言成本高昂且效果不佳,且缺乏针对多模态应用的实证证据。本文首次展示了变分贝叶斯在VQA选择性预测中的有效性和竞争优势。我们基于近期在深度学习中变分方法的进展,提出了一种扩展方法,称为“变分VQA”。该方法改进了校准效果,在VQA和视觉推理任务上实现显著的选择性预测提升,尤其在错误容忍度较低()时效果尤为显著。通常,仅一个后验样本就能提供比使用AdamW训练的模型更可靠的答案。此外,我们提出了一种新的风险对抗选择器,通过考虑预测方差来超越标准样本平均方法。总体而言,我们提供了强有力的证据表明,变分学习是使大型VLMs更安全更可信的可行选项。
引用
@article{arxiv.2505.09591,
title = {Variational Visual Question Answering for Uncertainty-Aware Selective Prediction},
author = {Tobias Jan Wieczorek and Nathalie Daun and Mohammad Emtiyaz Khan and Marcus Rohrbach},
journal= {arXiv preprint arXiv:2505.09591},
year = {2026}
}
备注
TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography