中文

简单词元级置信度提升描述正确性

计算机视觉与模式识别 2023-05-12 v1

摘要

判断描述是否正确地描述图像的能力是视觉-语言理解的关键部分。然而,最先进的模型常误判细粒度细节的正确性,导致生成描述中幻觉物体或组合推理能力差等输出错误。本工作中,我们探索词元级置信度(TLC)作为一种简单却出奇有效的方法来评估描述正确性。具体而言,我们在图像描述上微调一个视觉-语言模型,将图像与待评估描述输入模型,并聚合词或序列上的代数或学习得到的词元置信度来估计图像-描述一致性。与预训练模型的序列级分数相比,采用代数置信度度量的TLC在SVO-Probes的动词理解上相对准确率提升10%,并在Winoground的组合推理图像与组分数上分别以相对37%和9%优于先前最先进水平。当有训练数据可用时,学习得到的置信度估计器提供进一步改进的性能,在MS COCO Captions中将物体幻觉率相对原始模型降低30%,并创下新的最先进水平。

关键词

引用

@article{arxiv.2305.07021,
  title  = {Simple Token-Level Confidence Improves Caption Correctness},
  author = {Suzanne Petryk and Spencer Whitehead and Joseph E. Gonzalez and Trevor Darrell and Anna Rohrbach and Marcus Rohrbach},
  journal= {arXiv preprint arXiv:2305.07021},
  year   = {2023}
}