基于视觉实体可迁移解码的零样本图像描述生成
计算机视觉与模式识别
2023-08-01 v1 计算与语言
摘要
图像到文本生成旨在用自然语言描述图像。近来,基于预训练视觉-语言模型(VLMs)和大型语言模型(LLMs)的零样本图像描述生成取得了显著进展。然而,我们观察到并通过实验证明这些方法易受 LLM 引起的模态偏差影响,倾向于生成包含图像中实际不存在但在训练时频繁出现的物体(实体)的描述(即物体幻觉)。本文中,我们提出 ViECap,一种利用实体感知解码在已见和未见场景下生成描述的可迁移解码模型。ViECap 引入实体感知硬提示,将 LLM 的注意力引导至图像中存在的视觉实体,从而能够在多样场景中生成连贯的描述。借助实体感知硬提示,ViECap 在从域内迁移到域外场景时能够保持性能。大量实验表明,ViECap 在跨域(可迁移)描述生成上树立了新 SOTA,并与先前基于 VLMs 的零样本方法在域内描述生成上表现相当。我们的代码见:https://github.com/FeiElysia/ViECap
引用
@article{arxiv.2307.16525,
title = {Transferable Decoding with Visual Entities for Zero-Shot Image Captioning},
author = {Junjie Fei and Teng Wang and Jinrui Zhang and Zhenyu He and Chengjie Wang and Feng Zheng},
journal= {arXiv preprint arXiv:2307.16525},
year = {2023}
}
备注
Accepted by ICCV 2023