LMCap:基于检索增强语言模型提示的小样本多语言图像描述
计算与语言
2023-06-01 v1 计算机视觉与模式识别
摘要
多语言图像描述近来通过大规模机器翻译数据训练得以解决,这是一个昂贵、含噪且耗时的过程。在无需任何多语言描述数据的情况下,我们提出 LMCap,一种不看图像的小样本多语言描述模型,其通过用检索到的描述提示语言模型来工作。具体而言,不同于遵循标准的编码器-解码器范式,给定一张图像,LMCap 首先使用多语言 CLIP 编码器检索相似图像的描述。这些描述随后被组合为 XGLM 解码器的提示,以生成所需语言的描述。换言之,生成模型不直接处理图像,而是处理检索到的描述。在具有地理多样性的 XM3600 数据集上的实验表明,我们的模型与全监督多语言描述模型具有竞争力,且无需在任何描述数据上进行监督训练。
引用
@article{arxiv.2305.19821,
title = {LMCap: Few-shot Multilingual Image Captioning by Retrieval Augmented Language Model Prompting},
author = {Rita Ramos and Bruno Martins and Desmond Elliott},
journal= {arXiv preprint arXiv:2305.19821},
year = {2023}
}
备注
To appear in the Findings of ACL 2023