中文

独特图像描述:在CLIP引导的强化学习中利用ground truth描述

计算与语言 2024-02-22 v1 计算机视觉与模式识别

摘要

使用教师强制训练图像描述模型会导致非常通用的样本,而更具辨识度的描述在检索应用或为无障碍生成替代文本方面非常有用。强化学习(RL)允许将生成描述与输入图像之间的跨模态检索相似度得分作为奖励来指导训练,从而产生更具辨识度的描述。最近的研究表明,预训练的跨模态检索模型可用于提供此奖励,完全消除对参考描述的需求。然而,我们在本文中论证,ground truth(GT)描述在该RL框架中仍然有用。我们提出了一种新的图像描述模型训练策略,利用GT描述以不同方式。首先,它们可以用于训练一个简单的MLP判别器,作为正则化手段防止奖励作弊并确保生成描述的流畅性, resulting in a 扩展用于多模态输入的文本生成对抗网络(GAN)设置。其次,它们可作为RL策略中的额外轨迹, resulting in a 基于GT与图像相似度加权的教师强制损失。该目标充当基于GT描述分布的额外学习信号。第三,它们可作为用于计算所提出对比奖励的候选描述池中的强基准,从而降低梯度估计的方差。在MS-COCO数据集上的实验表明,所提出的训练策略在保持高写作质量的同时,能够产生高度具辨识度的描述。

关键词

引用

@article{arxiv.2402.13936,
  title  = {Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning},
  author = {Antoine Chaffin and Ewa Kijak and Vincent Claveau},
  journal= {arXiv preprint arXiv:2402.13936},
  year   = {2024}
}