基于无监督提示学习提升图像描述生成的泛化能力
计算机视觉与模式识别
2023-08-08 v1
摘要
预训练的视觉-语言模型在手写提示的辅助下,已展现出令人印象深刻的零样本图像描述生成能力。同时,手写提示利用人类先验知识引导模型。然而,由于不同领域间的多样性,此类提供不变先验知识的手写提示可能导致某些领域的模式崩塌。一些研究尝试引入专家知识与指令数据集,但代价高昂且导致幻觉。本文提出一种无监督提示学习方法以提升图像描述生成的泛化能力(GeneIC),该方法为目标领域学习领域特定的提示向量而无需标注数据。GeneIC 利用预训练的对比语言-图像预训练(CLIP)模型对齐视觉与语言模态,从而从属性与语义一致性两方面优化领域特定提示向量。具体而言,GeneIC 首先生成属性转移图像(属性不同但与原图保留语义相似度),随后使用 CLIP 度量图像与生成句子间的相似度。通过探究原图与属性转移图像中的可变与不变特征,属性一致性约束图像与句子的属性变化方向以学习领域特定知识;语义一致性直接度量生成句子与图像的相似度,以确保生成句子的准确性与全面性。因此,GeneIC 仅优化提示向量,有效保留了大模型中的知识并引入领域特定知识。
引用
@article{arxiv.2308.02862,
title = {Improving Generalization of Image Captioning with Unsupervised Prompt Learning},
author = {Hongchen Wei and Zhenzhong Chen},
journal= {arXiv preprint arXiv:2308.02862},
year = {2023}
}