中文

MAFA:管理视觉-语言预训练中的假阴性

计算机视觉与模式识别 2024-06-14 v2 人工智能

摘要

我们考虑了视觉-语言预训练(VLP)中一个关键的假阴性问题,这一挑战源于大规模网络爬取数据集中图像-文本对固有的多对多对应关系。假阴性的存在会阻碍模型达到最优性能,甚至导致性能显著下降。为应对这一挑战,我们提出了MAFA(管理假阴性),它基于最近发展的分组小批量采样(GRIT)策略,包含两个关键组成部分:1)一个高效的连接挖掘过程,用于识别假阴性并将其转换为阳性;2)针对图像-文本对比(ITC)损失的标签平滑。我们全面的实验验证了MAFA在多个下游任务中的有效性,强调了解决VLP中假阴性问题的关键作用,其重要性甚至可能超过解决假阳性问题。此外,MAFA与近期BLIP系列模型的兼容性也得到了验证。代码可在https://github.com/jaeseokbyun/MAFA获取。

关键词

引用

@article{arxiv.2312.06112,
  title  = {MAFA: Managing False Negatives for Vision-Language Pre-training},
  author = {Jaeseok Byun and Dohoon Kim and Taesup Moon},
  journal= {arXiv preprint arXiv:2312.06112},
  year   = {2024}
}

备注

CVPR 2024 camera ready version