具体丛林:面向构成性理解的具体化对比负采样
机器学习
2026-04-16 v1
摘要
视觉语言模型展现出惊人的能力,但在构成推理方面常常表现出局限,尤其是对词序和属性绑定的脆弱性。这种限制源于在对比预训练中区分细微语义差异所需的样本稀缺。虽然硬负采样提供了可行的解决方案,但现有方法缺乏明确机制来指示哪些语言元素发生修改。本研究将词汇具体性作为负样本有效性的基本决定因素。修改高度具体的术语可产生更显著的结构和视觉差异,提供更有力的学习信号。利用这一原则,提出 ConcretePlant 来系统性地隔离和操控感知锚定的概念。InfoNCE 分析进一步揭示了严重的梯度不平衡问题,即容易区分的配对对优化过程的支配比例过大,限制了用于细粒度学习的可用带宽。为解决这一退化,提出 Cement loss 采用基于间隔的方法。通过将心理语言学分数与样本难度相关联,该目标动态校准对 individual training pairs 的惩罚力度。全面评估 substantiate 这些理论主张。集成框架 Slipform 在 diverse 的构成评估基准、general cross-modal retrieval、single and multi label linear probing 上实现了最先进的准确率。
引用
@article{arxiv.2604.13313,
title = {Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding},
author = {Eun Woo Im and Dhruv Madhwal and Vivek Gupta},
journal= {arXiv preprint arXiv:2604.13313},
year = {2026}
}
备注
10 pages