基于原型的跨模态检索偶然不确定性量化
计算机视觉与模式识别
2024-01-17 v3
摘要
跨模态检索方法通过联合学习一个公共表示空间来构建视觉与语言模态之间的相似性关系。然而,由于低质量数据(如损坏图像、快节奏视频和非详尽文本)引起的偶然不确定性,预测往往不可靠。本文提出一种新颖的基于原型的偶然不确定性量化(PAU)框架,通过量化固有数据歧义所产生的不确定性来提供可信预测。具体地,我们首先为每个模态构建一组多样的可学习原型以表示整个语义子空间。然后利用 Dempster-Shafer 理论与主观逻辑理论,通过将证据与狄利克雷分布参数相关联来建立证据理论框架。PAU 模型为跨模态检索推导出准确的不确定性与可靠预测。在 MSR-VTT、MSVD、DiDeMo 和 MS-COCO 四个主要基准数据集上进行了大量实验,证明了方法的有效性。代码见 https://github.com/leolee99/PAU。
引用
@article{arxiv.2309.17093,
title = {Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval},
author = {Hao Li and Jingkuan Song and Lianli Gao and Xiaosu Zhu and Heng Tao Shen},
journal= {arXiv preprint arXiv:2309.17093},
year = {2024}
}
备注
Accepted to NeurIPS 2023