SmallCap:以检索增强提示的轻量级图像描述生成
计算机视觉与模式识别
2023-03-30 v2 计算与语言
摘要
近期图像描述生成的进展集中于扩大数据和模型规模,大幅增加了预训练与微调的成本。作为大型模型的替代方案,我们提出 SmallCap,其根据输入图像及从数据存储中检索到的相关描述生成 caption。我们的模型轻量且训练快速,因为唯一学习的参数位于新引入的预训练 CLIP 编码器与 GPT-2 解码器之间的交叉注意力层。SmallCap 无需额外微调即可迁移到新领域,并且由于数据存储的内容可随时替换,能够以无训练方式利用大规模数据。我们的实验表明,仅在 COCO 上训练的 SmallCap 在该基准上具有竞争力,并且仅通过从目标领域数据检索即可在不重新训练的情况下迁移到其他领域。通过无训练地利用多样化的人标和网页数据可取得进一步改进,这被证明对一系列领域有效,包括为测试对未见视觉概念泛化能力而设计的 nocaps 基准。
引用
@article{arxiv.2209.15323,
title = {SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation},
author = {Rita Ramos and Bruno Martins and Desmond Elliott and Yova Kementchedjhieva},
journal= {arXiv preprint arXiv:2209.15323},
year = {2023}
}
备注
Accepted to CVPR 2023