中文

基于分布对齐的领域特定语言-图像预训练方法 DALIP

斑图形成与孤子 2025-04-03 v1

摘要

最近,基于对比的语言-图像预训练(CLIP)在领域特定数据(如生物学)上展现出有前景的性能,并吸引了日益增多的研究关注。现有工作通常 focus 收集大量领域特定数据并直接调优原始 CLIP 模型。直觉上,这种范式充分考虑了领域特定数据(如生物学数据的细粒度特性)所蕴含的特征,而限制了模型能力,同时大多数情况下丢失了 CLIP 在通用领域的原始能力。本文我们提出一种针对生物学数据的分布对齐式语言-图像预训练方法(DALIP)。具体而言,DALIP 通过匹配图像-文本对特征分布的相似性来优化 CLIP 模型,而不是原始的 [cls] token,这可以捕获图像-文本对中固有且有效的丰富信息作为强大的表征,从而更好地应对生物学数据的细粒度特性。特别地,我们的 DALIP 通过其一阶和二阶统计量高效地近似特征分布,同时提出了多头布朗距离协方差(MBDC)模块来高效获取 token 特征的二阶统计量。 Furthermore,我们根据数据混合法则收集了一个新的植物领域数据集(如生物学领域的特定数据),包含 1000 万植物数据和 300 万通用领域数据(即 PlantMix-13M)。广泛的实验表明,DALIP 在生物学领域明显优于现有 CLIP 对手,同时良好地泛化到遥感和医学影像领域。此外,我们的 PlantMix-13M 数据集进一步提升了 DALIP 在植物领域的性能,同时保持了模型在通用领域的能力。

关键词

引用

@article{arxiv.2504.01385,
  title  = {Dynamics of ring solitons in an expanding cloud of a Bose-Einstein condensate},
  author = {A. M. Kamchatnov and B. I. Suleimanov and E. N. Tsoy},
  journal= {arXiv preprint arXiv:2504.01385},
  year   = {2025}
}

备注

10 pages, 3 figures