SynC:利用一对多映射精炼合成图像描述数据集用于零样本图像描述
计算机视觉与模式识别
2025-07-25 v1 人工智能
计算与语言
机器学习
摘要
零样本图像描述(ZIC)越来越多地利用由文本到图像(T2I)模型生成的合成数据集,以减少对昂贵人工标注的需求。然而,这些T2I模型生成的图像常与其对应输入描述存在语义错位(例如,缺失物体、属性错误),导致有噪声的合成图像-描述对,从而阻碍模型训练。现有的数据集修剪技术主要设计用于去除网络爬取数据中的噪声文本。然而,这些方法不适用于合成数据的独特挑战——其中描述通常格式良好,但图像可能是不准确的表示。为弥补这一空白,我们引入了SynC,一个专门为ZIC精炼合成图像-描述数据集而设计的新框架。SynC不采用传统的过滤或重新生成方法,而是专注于将描述重新分配给合成图像池中已存在的、语义最匹配的图像。我们的方法采用一对多映射策略,首先为每个描述检索多个相关的候选图像。然后,我们应用一个受循环一致性启发的对齐评分器,通过验证图像能否通过图像到文本检索找回原始描述来选择最佳图像。大量评估表明,SynC在标准基准(MS-COCO、Flickr30k、NoCaps)上持续且显著地提升了各种ZIC模型的性能,在多个场景中达到了最先进水平。SynC为策划精炼的合成数据以增强ZIC提供了一种有效策略。
引用
@article{arxiv.2507.18616,
title = {SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning},
author = {Si-Woo Kim and MinJu Jeon and Ye-Chan Kim and Soeun Lee and Taewhan Kim and Dong-Jin Kim},
journal= {arXiv preprint arXiv:2507.18616},
year = {2025}
}
备注
Accepted to ACM Multimedia 2025