中文

PolyGen:基于多生成器集Ensemble的全合成视觉语言训练

计算机视觉与模式识别 2026-02-03 v1 人工智能 机器学习

摘要

合成数据提供了可扩展的视觉语言预训练解决方案,但当前领先方法通常依赖扩大单一生成 backbone 的规模,这引入了生成器特定的谱偏差,限制了特征的多样性。本文引入 PolyGen 框架,重新定义合成数据构建方式,强调覆盖率和组合严谨性,而非简单的数据集规模。PolyGen 采用 Polylithic 方法,在 architecturally distinct 生成器的交集上进行训练,有效消除了模型特定的伪影。此外,我们引入程序化硬负面课程 (Programmatic Hard Negative curriculum),强制进行细粒度语法理解。通过结构性地将相同的数据预算从独特描述重新分配到多源变体,PolyGen 构建了更稳健的特征空间,在综合多任务基准和 SugarCrepe++ 组合性基准上分别超过领先的单一来源基线 (SynthCLIP) 19.0% 和 9.1%。这些结果表明,结构性多样性是比简单增加单一来源样本数量更具数据效率的扩展规律。

关键词

引用

@article{arxiv.2602.01370,
  title  = {PolyGen: Fully Synthetic Vision-Language Training via Multi-Generator Ensembles},
  author = {Leonardo Brusini and Cristian Sbrolli and Eugenio Lomurno and Toshihiko Yamasaki and Matteo Matteucci},
  journal= {arXiv preprint arXiv:2602.01370},
  year   = {2026}
}