TiMix:用于高效视觉-语言预训练的文本感知图像混合
机器学习
2024-02-27 v4 计算与语言
计算机视觉与模式识别
摘要
自监督多模态对比学习通过 aligning 视觉和语言模态,显著推进了现代视觉-语言预训练模型。然而,由于网络抓取的文本-图像对中存在噪声,在 SMCL 中扩大训练数据量在计算成本和数据效率方面带来了相当大的障碍。为了提高 VLP 中的数据效率,我们提出了文本感知图像混合,将基于混合的数据增强技术集成到 SMCL 中,在不显著增加计算开销的情况下带来了显著的性能提升。我们从互信息角度对 TiMix 进行了理论分析,表明用于跨模态对比学习的混合数据样本隐式地作为对比损失的 regularizer。实验结果表明,与现有方法相比,即使在减少训练数据和缩短训练时间的情况下,TiMix 在下游任务上也表现出相当的性能。这项工作从经验和理论上证明了数据混合对于数据高效且计算可行的 VLP 的潜力,有利于更广泛的 VLP 模型在实际场景中的应用。
引用
@article{arxiv.2312.08846,
title = {TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training},
author = {Chaoya Jiang and Wei ye and Haiyang Xu and Qinghao Ye and Ming Yan and Ji Zhang and Shikun Zhang},
journal= {arXiv preprint arXiv:2312.08846},
year = {2024}
}
备注
Accepted on AAAI2024