FALCON:视觉-语言对齐中对比负样本的假阴性感知学习
计算机视觉与模式识别
2026-03-18 v5 人工智能
摘要
由于大规模数据集中图像与文本之间存在多对多的对应关系,假阴性对视觉-语言预训练(VLP)构成了关键挑战。这些假阴性引入了冲突的监督信号,降低了所学嵌入空间的质量,并削弱了困难负样本采样的有效性。在本文中,我们提出了 FALCON(对比负样本的假阴性感知学习),这是一种基于学习的迷你批次构建策略,能在 VLP 期间自适应地平衡困难负样本与假阴性之间的权衡。FALCON 不依赖于固定的启发式方法,而是采用一个负样本挖掘调度器,在迷你批次构建过程中,以跨模态对齐改进的代理为指导,为每个锚点实例动态选择适当难度的负样本。实验结果表明,FALCON 在三个视觉-语言学习框架(ALBEF、BLIP-2、SigLIP-2)以及广泛的下游任务和评估设置中显著提升了性能,突显了其在减轻假阴性影响方面的有效性和鲁棒性。
引用
@article{arxiv.2505.11192,
title = {FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment},
author = {Myunsoo Kim and Seongwoong Shim and Byung-Jun Lee},
journal= {arXiv preprint arXiv:2505.11192},
year = {2026}
}
备注
Accepted at CVPR 2026