中文

基于正向增强对抗学习的视觉-语言评估与训练

计算机视觉与模式识别 2025-07-31 v2 人工智能 计算与语言 多媒体

摘要

尽管在标题生成方面取得了显著的进展,但现有的评估指标往往难以捕捉标题的完整质量或细粒度细节。这主要是由于依赖非特定的人类编写参考或噪声预训练数据。尽管如此,寻找有效的评估指标对于标题的评估以及生成阶段都至关重要。事实上,评估指标在标题生成模型的微调阶段确实发挥着关键作用,从而最终提高生成标题的质量。本文提出了PAC-S++,一种利用CLIP模型的可学习评估指标,该模型在web收集数据和清洁数据上进行预训练,并通过额外的生成视觉和文本正样本对进行正则化。利用这种更强大且精选的预训练方法,我们还将PAC-S++作为奖励应用于通常用于微调标题生成模型的Self-Critical Sequence Training(SCST)。在不同图像和视频数据集上的大量实验表明,PAC-S++在该任务方面有效,包括其对对象幻觉的敏感性。此外,我们展示了将PAC-S++集成到标题生成模型的微调阶段后,生成的标题语义更丰富,重复次数和语法错误更少。在out-of-domain基准测试上的评估进一步证明了我们微调方法在增强模型能力方面的有效性。源代码和训练好的模型均可公开获取,地址为:https://github.com/aimagelab/pacscore。

关键词

引用

@article{arxiv.2410.07336,
  title  = {Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training},
  author = {Sara Sarto and Nicholas Moratelli and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2410.07336},
  year   = {2025}
}

备注

International Journal of Computer Vision (2025)