从数据中榨取更多价值:困难样本对精炼在无额外数据下增强视觉-语言模型
计算机视觉与模式识别
2025-02-10 v3 计算与语言
摘要
对比语言-图像预训练(CLIP)已成为跨模态图像-文本表示学习的标配。改进 CLIP 通常需额外数据与采用新损失函数重训,但这些需求抬高了资源与时间成本,限制了实际应用。本文提出 HELIP,一种高性价比策略,通过在连续训练中利用现有数据集内的困难文本-图像对来改进 CLIP 模型,从而免去额外数据或大量重训之需。此外,HELIP 以极小代码改动无缝集成至当前训练流程,实现快捷平滑部署。在综合基准上,HELIP 持续提振现有模型。尤其在仅两个训练轮次内,其将基于 CC3M、CC12M 与 YFCC15M 数据集预训练的 SLIP 模型在 ImageNet 上的零样本分类准确率分别提升 3.05%、4.47% 与 10.1%。此外,在细粒度分类数据集上,HELIP 将 CLIP 与 SLIP 的零样本性能平均提升 8.4% 与 18.6%,并将其线性探测性能平均提升 9.5% 与 3.0%。代码公开于:https://github.com/haonan3/HELIP-NACCL-2025.git。
引用
@article{arxiv.2305.05208,
title = {Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data},
author = {Haonan Wang and Minbin Huang and Runhui Huang and Lanqing Hong and Hang Xu and Tianyang Hu and Xiaodan Liang and Zhenguo Li and Hong Cheng and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2305.05208},
year = {2025}
}
备注
Accepted to NAACL 2025, main conference. 20 pages, 10 figures, 10 tables