中文

当然不确定:面向多模态认知与测量不确定性的基准与指标

人工智能 2024-07-03 v1 计算与语言 计算机视觉与模式识别

摘要

认识到知识与推理中不可避免不确定性的能力,是 AI 系统真正实现诚实可靠的前提条件。本文提出了针对视觉语言 AI 系统的不确定性分类框架,区分源于信息缺乏的认知不确定性(epistemic uncertainty)与源于内在不可预测性的测量不确定性(aleatoric uncertainty),并进一步探讨其细分类别。基于该分类框架,我们合成了一个包含 17.8 万组视觉问答(VQA)样本的对比基准数据集《CertainlyUncertain》。其实现方式为:1)对图像进行填充,使原本可解答的提问变为不可解答;2)利用图像描述驱动大型语言模型生成可解答与不可解答的提问。此外,本文引入了新的指标——置信加权准确率(confidence-weighted accuracy),该指标与准确率和校准误差均高度相关,旨在解决现有指标的局限性。

关键词

引用

@article{arxiv.2407.01942,
  title  = {Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness},
  author = {Khyathi Raghavi Chandu and Linjie Li and Anas Awadalla and Ximing Lu and Jae Sung Park and Jack Hessel and Lijuan Wang and Yejin Choi},
  journal= {arXiv preprint arXiv:2407.01942},
  year   = {2024}
}

备注

26 pages