中文

从错到对:一种面向视觉语言解释的递归方法

计算机视觉与模式识别 2023-11-22 v1

摘要

针对在有限标注下使预训练视觉语言模型为视觉推理任务生成深刻解释的挑战,我们提出 ReVisE:一种递归视觉解释(Re\textbf{Re}cursive Vis\textbf{Vis}ual E\textbf{E}xplanation)算法。我们的方法迭代地计算视觉特征(以文本输入为条件)、答案与解释,逐步提升解释质量直至答案收敛。我们发现这种多步方法引导模型纠正自身答案,并优于单步解释生成。此外,ReVisE 生成的解释也可作为少样本自训练的宝贵标注。我们的方法在 10 项指标上仅使用 5% 的人标解释便优于以往方法,在 VCR 与 VQA-X 数据集上 BLEU-1 分数分别提升多达 4.2 与 1.3,彰显了该方法的有效性与数据高效性。

关键词

引用

@article{arxiv.2311.12391,
  title  = {From Wrong To Right: A Recursive Approach Towards Vision-Language Explanation},
  author = {Jiaxin Ge and Sanjay Subramanian and Trevor Darrell and Boyi Li},
  journal= {arXiv preprint arXiv:2311.12391},
  year   = {2023}
}

备注

EMNLP 2023 Main