中文

利用自训练奖励模型实现流畅且准确的图像描述

计算机视觉与模式识别 2024-09-02 v1

摘要

使用诸如 CIDEr 指标等手工设计的奖励来微调图像描述模型,一直是在序列层面提升描述质量的经典策略。然而,已知这种方法会限制描述性和语义丰富度,并倾向于使模型趋向于真实句子的风格,从而丢失细节和特异性。相反,最近尝试采用 CLIP 等图文模型作为奖励的做法导致了语法错误和重复的描述。在本文中,我们提出了 Self-Cap,一种依赖于基于自生成负样本的可学习奖励模型的描述方法,该方法能够根据描述与图像的一致性来区分描述。具体而言,我们的判别器是一个微调的对比图文模型,经过训练以提升描述正确性,同时避免使用 CLIP 奖励训练时通常出现的异常。为此,我们的判别器直接整合了来自冻结描述器的负样本,这不仅显著提升了生成描述的质量和丰富度,而且与仅使用 CIDEr 分数作为优化指标相比,还减少了微调时间。实验结果证明了我们的训练策略在标准图像描述数据集和零样本图像描述数据集上的有效性。

关键词

引用

@article{arxiv.2408.16827,
  title  = {Fluent and Accurate Image Captioning with a Self-Trained Reward Model},
  author = {Nicholas Moratelli and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2408.16827},
  year   = {2024}
}

备注

ICPR 2024