中文

通过直接基于 CLIP 的优化重访图像描述训练范式

计算机视觉与模式识别 2024-08-28 v1 人工智能 计算与语言 多媒体

摘要

图像描述的常规训练方法包括使用教学强制进行网络预训练,然后通过自关键序列训练进行微调,以最大化手工制作的描述指标。然而, attempts to optimize modern and higher-quality metrics like CLIP-Score and PAC-Score时,这种训练方法常常遇到不稳定性,无法获得产生流畅且信息丰富描述所需的真实描述能力。在本文中,我们提出了一种新的训练范式,称为直接基于 CLIP 的优化(Direct CLIP-Based Optimization, DiCO)。我们的方法联合学习和优化一个从具有高人类相关性的可学习描述评估器提炼的奖励模型。这通过在描述器内部直接解决一个加权分类问题来实现。同时,DiCO 防止模型发生偏离原始模型,确保流畅性得以维持。DiCO 不仅在生成的描述中表现出更好的稳定性和更高的质量,还与人类偏好更 closely 对齐,尤其是在现代指标方面。此外,它在传统指标方面也保持了竞争性能。我们的源代码和训练好的模型已在 https://github.com/aimagelab/DiCO 上公开。

关键词

引用

@article{arxiv.2408.14547,
  title  = {Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization},
  author = {Nicholas Moratelli and Davide Caffagni and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2408.14547},
  year   = {2024}
}

备注

BMVC 2024