中文

ProbMCL:用于多标签视觉分类的简单概率对比学习

计算机视觉与模式识别 2024-04-15 v2 机器学习

摘要

多标签图像分类在包括计算机视觉和医学成像在内的许多领域中都是一项具有挑战性的任务。最近的进展引入了基于图和基于Transformer的方法以提高性能并捕获标签依赖关系。然而,这些方法通常包含复杂的模块,需要大量计算且缺乏可解释性。在本文中,我们提出了概率多标签对比学习(ProbMCL),一种新颖的框架来应对多标签图像分类任务中的这些挑战。我们简单而有效的方法采用监督对比学习,其中基于决策阈值与锚图像共享足够标签的样本被引入为正样本集。这种结构通过将正样本对嵌入拉近并推开低于阈值的负样本来捕获标签依赖关系。我们通过将混合密度网络融入对比学习并生成高斯混合分布来探索特征编码器的认知不确定性,从而增强表示学习。我们通过在计算机视觉和医学成像领域的数据集上进行实验验证了我们框架的有效性。我们的方法在两个数据集上均优于现有最先进方法,同时实现了低计算开销。可视化分析还表明,ProbMCL学习的分类器保持了有意义的语义拓扑。

关键词

引用

@article{arxiv.2401.01448,
  title  = {ProbMCL: Simple Probabilistic Contrastive Learning for Multi-label Visual Classification},
  author = {Ahmad Sajedi and Samir Khaki and Yuri A. Lawryshyn and Konstantinos N. Plataniotis},
  journal= {arXiv preprint arXiv:2401.01448},
  year   = {2024}
}

备注

This paper has been accepted for the ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)