T-MARS:通过规避文本特征学习改进视觉表征
计算机视觉与模式识别
2024-03-20 v2 计算与语言
机器学习
摘要
大规模网络多模态数据集推动了许多学习通用视觉表征的新方法,推进了计算机视觉的最先进水平,并革新了零样本与少样本识别。实践者面临的一个关键决策是是否以及如何筛选这些不断扩大的数据集。例如,LAION-5B 数据集的创建者选择仅保留 CLIP 相似度分数超过指定阈值的图像-文本对。本文中,我们提出了一种全新的最先进数据过滤方法,其动机源于我们的观察:LAION 中近 40% 的图像包含与文本描述显著重叠的文本。直观上,此类数据可能是浪费的,因为它会激励模型执行光学字符识别而非学习视觉特征。然而,朴素地移除所有此类数据同样可能造成浪费,因为这样会丢弃同时包含视觉特征(以及重叠文本)的图像。我们简单且可扩展的方法 T-MARS(Text Masking and Re-Scoring,文本掩码与重打分)仅过滤掉文本主导剩余视觉特征的图像对——先掩码掉文本,再过滤掉掩码后图像 CLIP 相似度分数较低的对。在实验上,T-MARS 在 DataComp(一个数据过滤基准)的“中等规模”上以 ImageNet 上 6.5% 和 VTAB 上 4.7% 的优势超越了排名最高的方法。此外,我们在 2M 到 64M 不同数据池规模上的系统评估表明,随着数据和计算呈指数级扩展,T-MARS 所获得的准确率增益线性增长。代码见 https://github.com/locuslab/T-MARS。
引用
@article{arxiv.2307.03132,
title = {T-MARS: Improving Visual Representations by Circumventing Text Feature Learning},
author = {Pratyush Maini and Sachin Goyal and Zachary C. Lipton and J. Zico Kolter and Aditi Raghunathan},
journal= {arXiv preprint arXiv:2307.03132},
year = {2024}
}
备注
Accepted to ICLR 2024. Oral at ICCV Datacomp 2023