改进的概率图像-文本表示
计算机视觉与模式识别
2024-04-10 v5 机器学习
摘要
图像-文本匹配(ITM)任务作为基础的视觉-语言(VL)任务,受到由多义性和不完美标注引起的固有模糊性困扰。确定性函数不足以强大到捕捉模糊性,促使人们探索概率嵌入以应对该挑战。然而,现有概率 ITM 方法面临两个关键缺陷:由于蒙特卡洛近似带来的沉重计算负担,以及在大量假负样本面前的损失饱和问题。为克服这些问题,本文提出一种改进的概率跨模态嵌入(命名为 PCME++),引入具有闭式解的新概率距离。此外,提出两种优化技术以进一步增强 PCME++:第一,引入伪正样本以防止在大量假负样本下的负面效应;第二,用于概率匹配的混合样本数据增强。在 MS-COCO Caption 及两个扩展基准 CxC 和 ECCV Caption 上的实验结果证明了 PCME++ 相较 SOTA ITM 方法的有效性。PCME++ 的鲁棒性也在含噪图像-文本对应下得到评估。此外,展示了 PCME++ 在零样本分类的自动提示过滤中的潜在适用性。代码见 https://github.com/naver-ai/pcmepp
引用
@article{arxiv.2305.18171,
title = {Improved Probabilistic Image-Text Representations},
author = {Sanghyuk Chun},
journal= {arXiv preprint arXiv:2305.18171},
year = {2024}
}
备注
ICLR 2024 camera-ready; Code: https://github.com/naver-ai/pcmepp. Project page: https://naver-ai.github.io/pcmepp/. 30 pages, 2.2 MB