中文

通过多模态提示检索学习真假标签

机器学习 2025-06-04 v2 计算机视觉与模式识别

摘要

预训练视觉语言模型 (VLMs) 表现出强大的零样本分类能力,显示出生成弱监督标签的巨大潜力。然而,现有的弱监督学习方法在生成由 VLMs 生成的准确标签方面能力不足。本文提出一种新颖的弱监督标注设置,即真假标签 (TFLs),可在 VLMs 生成时实现高准确率。TFL 表示实例是否属于该标签,该标签从候选标签集合中随机且均匀抽样。具体而言,我们在理论上推导了一个风险一致的估计器,以探索和利用 TFLs 的条件概率分布信息。此外,我们提出一种基于卷积的多模态提示检索 (MRP) 方法,以弥合 VLMs 知识与目标学习任务之间的差距。实验结果表明,所提出的 TFL 设置和 MRP 学习方法有效。复现实验的代码可在 https://github.com/Tranquilxu/TMP 获取。

关键词

引用

@article{arxiv.2405.15228,
  title  = {Learning from True-False Labels via Multi-modal Prompt Retrieving},
  author = {Zhongnian Li and Jinghao Xu and Peng Ying and Meng Wei and Xinzheng Xu},
  journal= {arXiv preprint arXiv:2405.15228},
  year   = {2025}
}

备注

15 pages, 5 figures