中文

双重正确目标识别:用于视觉理据的为何提示

计算机视觉与模式识别 2023-03-27 v2

摘要

许多视觉识别模型仅依据分类准确率进行评估,而它们在该指标上表现强劲。在本文中,我们研究计算机视觉模型是否也能为其预测提供正确的理据。我们提出了一个“双重正确”目标识别基准,该指标要求模型同时给出正确的标签与正确的理据。我们发现,诸如CLIP等最先进的视觉模型常为其类别预测提供不正确的理据。然而,通过经定制数据集将语言模型中的理据迁移至视觉表征,我们展示了可以学习一个“为何提示”(why prompt),其适配大型视觉表征以产生正确理据。可视化与实证实验表明,我们的提示显著提升了双重正确目标识别上的性能,此外还实现了向未见任务与数据集的零样本迁移。

关键词

引用

@article{arxiv.2212.06202,
  title  = {Doubly Right Object Recognition: A Why Prompt for Visual Rationales},
  author = {Chengzhi Mao and Revant Teotia and Amrutha Sundar and Sachit Menon and Junfeng Yang and Xin Wang and Carl Vondrick},
  journal= {arXiv preprint arXiv:2212.06202},
  year   = {2023}
}

备注

Accepted at CVPR 2023