利用知识图谱获取数据集以实现高效的CLIP模型训练
计算机视觉与模式识别
2025-10-01 v3 计算与语言
信息检索
机器学习
摘要
训练高质量的CLIP模型通常需要海量数据集,这限制了领域特定模型的发展——尤其是在那些即使最大的CLIP模型也无法很好覆盖的领域——并推高了训练成本。这对需要精细控制CLIP模型训练过程的科学研究构成了挑战。在这项工作中,我们展示了通过采用知识图谱增强的智能网络搜索策略,可以用少得多的数据从头训练一个稳健的CLIP模型。具体来说,我们证明了仅用1000万张图像就可以构建一个针对生物体的专家基础模型。此外,我们引入了EntityNet,一个包含3300万张图像和4600万条文本描述的数据集,它能够在显著缩短的时间内训练一个通用的CLIP模型。
引用
@article{arxiv.2505.02746,
title = {Using Knowledge Graphs to harvest datasets for efficient CLIP model training},
author = {Simon Ging and Sebastian Walter and Jelena Bratulić and Johannes Dienert and Hannah Bast and Thomas Brox},
journal= {arXiv preprint arXiv:2505.02746},
year = {2025}
}
备注
Accepted for oral presentation at GCPR 2025 (German Conference on Pattern Recognition). This is the version submitted to the conference, not the official conference proceedings