中文

可靠的视觉问答:弃权而非错误作答

计算机视觉与模式识别 2022-10-21 v3

摘要

机器学习已取得巨大进展,在视觉问答(VQA)等多模态任务中缩小了与人类的精度差距。然而,当人类不确定时可以表示“我不知道”(即放弃回答问题),尽管该问题对 VQA 在实际场景中的使用十分重要,这种能力在多模态研究中却被 largely 忽视。在本文中,我们提出一种可靠 VQA 的问题表述,即我们偏好弃权而非给出错误答案。我们首先为若干 VQA 模型赋予弃权能力,并分析其覆盖度(已回答问题的比例)和风险(该部分上的错误率)。为此,我们探索了几种弃权方法。我们发现,尽管性能最佳的模型在 VQA v2 数据集上达到超过 70% 的精度,但直接利用模型 softmax 分数引入弃权选项,将它们限制在回答少于 7.5% 的问题时才能达到低风险(即 1%)错误。这促使我们利用多模态选择函数直接估计预测答案的正确性,结果表明这可将覆盖度提升,例如,在 1% 风险下从 6.8% 提高到 15.6%(提升 2.3 倍)。尽管分析覆盖度和风险均很重要,但这些指标存在权衡,使得 VQA 模型比较具挑战性。为此,我们还提出了一种面向 VQA 的有效可靠性(Effective Reliability)度量,其对错误答案施加比弃权更大的代价。这一新的问题表述、度量与分析为构建高效且可靠的 VQA 模型奠定了基础,此类模型具备自我意识,当且仅当不知答案时才弃权。

关键词

引用

@article{arxiv.2204.13631,
  title  = {Reliable Visual Question Answering: Abstain Rather Than Answer Incorrectly},
  author = {Spencer Whitehead and Suzanne Petryk and Vedaad Shakib and Joseph Gonzalez and Trevor Darrell and Anna Rohrbach and Marcus Rohrbach},
  journal= {arXiv preprint arXiv:2204.13631},
  year   = {2022}
}

备注

ECCV 2022. Code and models are available here: https://github.com/facebookresearch/reliable_vqa