基于负增强样本提升细粒度视觉语言预训练
计算机视觉与模式识别
2024-12-16 v1
摘要
视觉语言预训练(VLP)方法已在各种视觉语言任务上取得显著的改进,证明其在捕获粗粒度语义相关性方面的有效性。然而,它们在细粒度理解方面的能力仍受到限制,这对于许多需要精细感知的视觉语言应用至关重要。主流 VLP 模型常常忽略不同模态特征表达中的细微差异,通常依赖整体特征的相似性进行跨模态交互。此外,这些模型直接对来自不同模态的特征进行对齐和集成,更多地关注粗粒度的通用表征,从而无法捕捉到需要更详细感知的任务所必需的细微差异。针对这些限制,我们引入负增强样本(NAS),一种新的视觉语言预训练模型,通过创造性地将 NAS 纳入预训练以特别解决细粒度理解的挑战。NAS 利用视觉词典(VD)作为视觉域与语言域之间的语义桥梁。此外,它基于 VD 采用负视觉增强(NVA)方法生成具有挑战性的负面图像样本。这些样本仅在 token 级别上偏离正样本,从而要求模型更精确地 discern 样本之间的细微差异。全面的实验验证了 NAS 组件的有效性,并凸显了其提升细粒度视觉语言理解的潜力。
引用
@article{arxiv.2412.10029,
title = {Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples},
author = {Yeyuan Wang and Dehong Gao and Lei Yi and Linbo Jin and Jinxia Zhang and Libin Yang and Xiaoyan Cai},
journal= {arXiv preprint arXiv:2412.10029},
year = {2024}
}
备注
15pages, Accepted by AAAI2025, full paper