中文

基于标签引导的掩码视图与类别感知 Transformer 的不完整多视图多标签学习

计算机视觉与模式识别 2023-03-14 v1 机器学习

摘要

众所周知,多视图数据比单视图数据更具表达力,多标签标注比单标签享有更丰富的监督信息,这使得多视图多标签学习广泛应用于各种模式识别任务。在这一复杂的表示学习问题中,三个主要挑战可概括如下:i) 如何学习样本在所有视图间的一致表示?ii) 如何挖掘并利用多标签的类别相关性以引导推断?iii) 如何避免视图或标签不完整带来的负面影响?为应对这些问题,本文提出一种通用的多视图多标签学习框架,称为标签引导的掩码视图与类别感知 Transformer。首先,我们设计两个基于 Transformer 风格的模块,分别用于跨视图特征聚合与多标签分类。前者在提取视图特定特征的过程中聚合来自不同视图的信息,后者学习子类别嵌入以提升分类性能。其次,考虑到各视图间表达能力的失衡,提出一种自适应加权视图融合模块以获得视图一致嵌入特征。第三,我们在样本级表示学习中施加标签流形约束,以最大化监督信息的利用。最后但同样重要的是,所有模块均在不完整视图与标签的前提下设计,这使我们的方法能适应任意多视图与多标签数据。在五个数据集上的大量实验证实,我们的方法相较其他最先进(SOTA)方法具有明显优势。

关键词

引用

@article{arxiv.2303.07180,
  title  = {Incomplete Multi-View Multi-Label Learning via Label-Guided Masked View- and Category-Aware Transformers},
  author = {Chengliang Liu and Jie Wen and Xiaoling Luo and Yong Xu},
  journal= {arXiv preprint arXiv:2303.07180},
  year   = {2023}
}

备注

Accepted to AAAI-23