基于自丢弃与双重权重的鲁棒噪声配对学习
计算机视觉与模式识别
2024-12-12 v2
摘要
许多研究者通过众包或网页抓取方式收集数据,以缓解跨模态匹配所致的数据稀缺问题。尽管如此,这种做法不可避免地会引入不匹配的配对,导致噪声配对问题。当前方法利用深度神经网络的记忆效应来区分噪声并进行重新加权。然而,仅仅降低噪声配对的权重无法在训练过程中消除其负面影响。本文提出了一种新颖的自丢弃和双重权重方法,通过细分数据实现精细的数据处理。具体而言,我们的方法将所有数据划分为四类:干净且显著、干净但不显著、模糊和噪声。我们分析了噪声和干净数据对的影响,发现对于视觉语言预训练模型,少量干净样本的价值往往超过大量噪声样本。基于这一观察,我们采用自丢弃技术丢弃噪声样本,以有效缓解噪声的影响。此外,我们采用双重权重策略,确保模型在关注显著样本的同时,合理地利用模糊样本。与先前方法相比,我们的方法在噪声数据上更具鲁棒性,尤其在高噪声比率下表现出更稳定的性能。在三个广泛使用的数据集上进行的大量实验验证了我们方法的有效性,包括Flickr30K、MS-COCO和Conceptual Captions。
引用
@article{arxiv.2412.06172,
title = {Robust Noisy Correspondence Learning via Self-Drop and Dual-Weight},
author = {Fan Liu and Chenwei Dong and Chuanyi Zhang and Hualiang Zhou and Jun Zhou},
journal= {arXiv preprint arXiv:2412.06172},
year = {2024}
}