HYPE:针对欠指定图像与文本的双曲蕴含过滤
计算机视觉与模式识别
2024-07-17 v2
摘要
在数据量驱动自监督学习有效性的时代,数据语义的特异性和清晰度在模型训练中起着至关重要的作用。针对这一问题,我们引入了双曲蕴含过滤(HYPE),这是一种新颖的方法,旨在从海量且含噪的图像-文本对数据集中细致地提取各模态内有意义且良好对齐的数据。我们的方法利用双曲嵌入和蕴含锥的概念来评估并过滤掉语义无意义或欠指定的样本,重点在于增强每个数据样本的特异性。HYPE 不仅在过滤效率上展现出显著提升,而且在结合现有过滤技术时在 DataComp 基准上创造了新的 SOTA。这一突破展示了 HYPE 优化数据选择过程的潜力,从而有助于开发更准确、更高效的自监督学习模型。此外,图像特异性 可以独立应用,从图像-文本或仅图像数据池中诱导出仅图像数据集,用于训练仅图像自监督模型,并且与由 CLIP score 诱导的数据集相比表现出更优的性能。
引用
@article{arxiv.2404.17507,
title = {HYPE: Hyperbolic Entailment Filtering for Underspecified Images and Texts},
author = {Wonjae Kim and Sanghyuk Chun and Taekyung Kim and Dongyoon Han and Sangdoo Yun},
journal= {arXiv preprint arXiv:2404.17507},
year = {2024}
}
备注
ECCV 2024; 33pages, 4.5MB