面向多模态文本-图像分析的自监督对比学习综述
计算机视觉与模式识别
2025-10-13 v5 机器学习
摘要
自监督学习是一种机器学习方法,它通过学习潜在模式并从无标签数据中提取判别性特征来生成隐式标签,而无需人工标注。对比学习引入了“正”样本和“负”样本的概念,其中正样本对(例如,同一图像/物体的变体)在嵌入空间中被拉近,而负样本对(例如,来自不同图像/物体的视图)被推远。这种方法在图像理解和图像文本分析中展现出了显著的改进,且对标注数据的依赖较少。在本文中,我们全面讨论了对比学习在文本-图像模型方面的术语、最新进展和应用。具体而言,我们概述了近年来文本-图像模型中的对比学习方法。其次,我们根据不同的模型结构对这些方法进行了分类。第三,我们进一步介绍并讨论了该过程中所用技术的最新进展,例如图像和文本的代理任务、架构结构以及关键趋势。最后,我们讨论了基于自监督对比学习的文本-图像模型的最新前沿应用。
引用
@article{arxiv.2503.11101,
title = {A Survey on Self-supervised Contrastive Learning for Multimodal Text-Image Analysis},
author = {Asifullah Khan and Laiba Asmatullah and Anza Malik and Shahzaib Khan and Hamna Asif},
journal= {arXiv preprint arXiv:2503.11101},
year = {2025}
}
备注
38 pages, 8 figures, survey paper