检测缺乏足够语境的多模态情境并对无根据预测进行放弃
计算机视觉与模式识别
2025-04-01 v4 人工智能
多媒体
摘要
尽管 VQA v2、OKVQA、A-OKVQA、GQA、VCR、SWAG 和 VisualCOMET 等基于视觉-语言理解 (VLU) 的基准广泛采用,但我们的分析揭示这些基准普遍存在一个严重问题:其中包含答案依赖于无法由提供语境所支持的假设的样本。训练模型以此类数据会导致偏差性学习和幻觉,因模型倾向于作出类似的无根据假设。为此,我们收集每个样本可得的语境数据,并训练语境选择模块以促进基于证据的模型预测。强大的跨基准改进表明我们方法的有效性。进一步,我们开发了通用的 Context-AwaRe Abstention (CARA) 检测器,用于识别缺乏足够语境的样本,并通过在所需语境缺失时放弃响应来提高模型准确率。CARA 能泛化到未训练过的新基准,这凸显了其在检测或清理语境不足样本方面的未来 VLU 基准价值。最后,我们策划了 Context Ambiguity and Sufficiency Evaluation (CASE) 集合,用于衡量不足够语境检测器的性能。总体而言,我们的工作代表了在复杂现实场景中确保视觉-语言模型生成可信且基于证据的输出的重大进展。
引用
@article{arxiv.2405.11145,
title = {Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions},
author = {Junzhang Liu and Zhecan Wang and Hammad Ayyubi and Haoxuan You and Chris Thomas and Rui Sun and Shih-Fu Chang and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2405.11145},
year = {2025}
}