Role-SynthCLIP:基于角色扮演的多样化合成数据方法
计算机视觉与模式识别
2025-11-10 v1
摘要
对比语言-图像预训练(CLIP)模型的有效性严重依赖于其训练数据的语义多样性和质量。然而,现有合成数据生成方法主要侧重于增加数据volume,这往往导致语义多样性受限、caption冗余或浅层。为此,我们提出Role-SynthCLIP——一种新型数据合成框架,通过多视角角色扮演提示词(如“构图分析师”、“图像语境解释者”)引导多模态大语言模型(MLM)从不同视角生成语义多样化的caption。该机制增强了合成数据对的语义多样性和细粒度图像-文本对齐,从而提升caption的表达力和准确性,同时保持图像-文本对总数不变。实验结果表明,我们的方法有效且高效。仅用100万个Role-SynthCLIP训练数据的CLIP-B/16模型,在MS COCO验证集上实现Recall@1为64.1%,超越现有最佳合成数据基线(500万个样本)2.8个百分点。代码和训练好的模型已发布于https://github.com/huangfu170/Role-SynthCLIP。
引用
@article{arxiv.2511.05057,
title = {Role-SynthCLIP: A Role Play Driven Diverse Synthetic Data Approach},
author = {Yuanxiang Huangfu and Chaochao Wang and Weilei Wang},
journal= {arXiv preprint arXiv:2511.05057},
year = {2025}
}