中文

CycleCap:通过自监督循环一致性微调提升视觉语言模型描述性能

计算机视觉与模式识别 2026-03-23 v2

摘要

视觉语言模型(VLMs)在图像描述、视觉问答和视觉推理方面取得了显著进展。然而它们仍容易出现视觉语言错位,常产生过于笼统或幻觉的描述。现有方法通过指令调优实现——需要昂贵的大规模标注数据集——或通过复杂的测试时框架进行描述精炼。在本工作中,我们从循环一致性的角度重新审视图像-文本对齐:给定图像和由图像到文本模型生成的描述,经过文本到图像模型的反向映射应能重构出与原始图像高度吻合的图像。在我们的设置中,VLM作为图像到文本组件,而预训练的文本到图像模型通过从生成的描述重构图像来完成闭环。基于此,我们引入CycleCap,这是一种改进图像描述微调方案,利用基于原始图像与重构图像相似度的奖励信号,通过Group Relative Policy Optimization(GRPO)进行微调。与之前利用循环一致性损失进行偏好数据集构建的方法不同,我们的方法直接将循环一致性用作自监督训练信号。这使得仅需原始图像即可使用,无需精心挑选的图像-文本数据集,同时引导VLM产生更准确、更可靠的文本描述。应用于4个参数规模从1B至7B的VLMs时,CycleCap在描述和幻觉基准测试中均实现了一致的改进,超越了依赖监督循环一致性训练的前沿方法。

关键词

引用

@article{arxiv.2603.18282,
  title  = {CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning},
  author = {Marios Krestenitis and Christos Tzelepis and Konstantinos Ioannidis and Stefanos Vrochidis and Ioannis Kompatsiaris and Georgios Tzimiropoulos and Shaogang Gong and Ioannis Patras},
  journal= {arXiv preprint arXiv:2603.18282},
  year   = {2026}
}