中文

检测缺乏足够语境的多模态情境并对无根据预测进行放弃

计算机视觉与模式识别 2025-04-01 v4 人工智能 多媒体

摘要

尽管 VQA v2、OKVQA、A-OKVQA、GQA、VCR、SWAG 和 VisualCOMET 等基于视觉-语言理解 (VLU) 的基准广泛采用,但我们的分析揭示这些基准普遍存在一个严重问题:其中包含答案依赖于无法由提供语境所支持的假设的样本。训练模型以此类数据会导致偏差性学习和幻觉,因模型倾向于作出类似的无根据假设。为此,我们收集每个样本可得的语境数据,并训练语境选择模块以促进基于证据的模型预测。强大的跨基准改进表明我们方法的有效性。进一步,我们开发了通用的 Context-AwaRe Abstention (CARA) 检测器,用于识别缺乏足够语境的样本,并通过在所需语境缺失时放弃响应来提高模型准确率。CARA 能泛化到未训练过的新基准,这凸显了其在检测或清理语境不足样本方面的未来 VLU 基准价值。最后,我们策划了 Context Ambiguity and Sufficiency Evaluation (CASE) 集合,用于衡量不足够语境检测器的性能。总体而言,我们的工作代表了在复杂现实场景中确保视觉-语言模型生成可信且基于证据的输出的重大进展。

关键词

引用

@article{arxiv.2405.11145,
  title  = {Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions},
  author = {Junzhang Liu and Zhecan Wang and Hammad Ayyubi and Haoxuan You and Chris Thomas and Rui Sun and Shih-Fu Chang and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2405.11145},
  year   = {2025}
}