无需硬负样本:概念中心学习实现组合性且不损害对比模型的零样本能力
计算机视觉与模式识别
2026-05-20 v2 机器学习
摘要
对比视觉-语言(V&L)模型仍然是各种应用的热门选择。然而,已出现若干局限性,最显著的是 V&L 模型学习组合表示的能力有限。先验方法通常通过生成自定义训练数据来获取硬负样本以解决这一局限性。硬负样本已被证明能提升组合性任务的表现,但往往仅针对单一基准,不具泛化性,并且可能导致基本 V&L 能力(如零样本或检索性能)的显著退化,使其不切实际。在本工作中,我们采用了一种不同的方法。我们识别出限制 V&L 组合性表现的两个根本原因:1)长训练标题不需要组合表示;2)文本和图像编码器中最终的全局池化导致学习绑定所需信息的完全丢失。作为补救措施,我们提出两种简单方案:1)我们使用标准 NLP 软件获取短概念中心标题片段,并将其与图像对齐;2)我们引入一种无参数的跨模态注意力池化,从图像编码器中获取概念中心视觉嵌入。通过这两项改动和简单的辅助对比损失,我们在标准组合性基准上取得了 SOTA 性能,同时保持或提升了强大的零样本和检索能力。这在不增加推理成本的情况下实现。我们发布了本工作的代码:https://github.com/saic-fi/concept_centric_clip。
引用
@article{arxiv.2603.25722,
title = {No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models},
author = {Hai X. Pham and David T. Hoffmann and Ricardo Guerrero and Brais Martinez},
journal= {arXiv preprint arXiv:2603.25722},
year = {2026}
}
备注
Accepted at CVPR 2026. 2nd rev: update github repo URL