中文

基于局部特征选择的多模态交叉交互多标签少样本图像分类建模

计算机视觉与模式识别 2025-02-25 v2

摘要

多标签少样本图像分类 (ML-FSIC) 的目标是在每个标签仅有少量训练样本可用的情况下,为图像分配语义标签。多标签设置的一个关键特征是一张图像通常具有多个标签,这些标签通常指代图像不同区域中出现的对象。因此,在基于度量的设置中估计标签原型时,确定哪些区域与哪些标签相关非常重要,但有限的训练数据量和局部特征的噪声特性使这极具挑战性。作为解决方案,我们提出了一种逐步细化标签原型的策略。首先,我们使用词嵌入初始化原型,这使我们能够利用关于标签含义的先验知识。其次,利用这些初始原型,我们使用损失变化度量 (LCM) 策略从训练图像(即支持集)中选择最有可能代表给定标签的局部特征。第三,我们使用多模态交叉交互机制聚合这些具有代表性的局部特征来构建标签的最终原型,该机制同样依赖于基于词嵌入的初始原型。在 COCO、PASCAL VOC、NUS-WIDE 和 iMaterialist 上的实验表明,我们的模型显著提升了当前的最优水平。

关键词

引用

@article{arxiv.2412.13732,
  title  = {Modeling Multi-modal Cross-interaction for Multi-label Few-shot Image Classification Based on Local Feature Selection},
  author = {Kun Yan and Zied Bouraoui and Fangyun Wei and Chang Xu and Ping Wang and Shoaib Jameel and Steven Schockaert},
  journal= {arXiv preprint arXiv:2412.13732},
  year   = {2025}
}

备注

In Transactions on Multimedia Computing Communications and Applications. arXiv admin note: text overlap with arXiv:2112.01037