中文

基于检索增强伪句子生成的免标注图像描述探索

计算机视觉与模式识别 2024-10-15 v3 人工智能

摘要

近来,无需标注图像-句子对训练图像描述器受到关注。先前方法受限于使用不匹配语料产生不准确的伪标注,或依赖资源密集的预训练。为缓解这些挑战,我们提出一种新策略:将大型预训练模型(LPMs)的先验知识蒸馏并用作监督,并集成检索过程以进一步增强其有效性。具体而言,我们提出检索增强伪句子生成(RaPSG),其可从不匹配语料中高效检索高度相关的短区域描述,并通过 LPMs 生成多种高质量伪句子。此外,我们引入流畅性过滤器与 CLIP 引导目标以增强对比信息学习。实验结果表明,我们的方法在零样本、无监督、半监督及跨域等多种设定下均优于 SOTA 描述模型。代码见:https://github.com/Zhiyuan-Li-John/RaPSG。

关键词

引用

@article{arxiv.2307.14750,
  title  = {Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation},
  author = {Zhiyuan Li and Dongnan Liu and Heng Wang and Chaoyi Zhang and Weidong Cai},
  journal= {arXiv preprint arXiv:2307.14750},
  year   = {2024}
}

备注

Accepted by ACM Multimedia Asia 2024