中文

单模态与多模态数据上的联合表示学习与新类别发现

计算机视觉与模式识别 2021-10-18 v3

摘要

本文研究在带有来自不同但相关类别的标签的单模态与多模态数据上进行新类别发现问题。我们提出一个通用的端到端框架,以联合学习可靠的表示并为未标记数据分配簇。为避免所学嵌入对标记数据的过拟合,我们从自监督表示学习中的噪声对比估计获得启发,并将其扩展以联合处理标记和未标记数据。具体而言,我们提出对标记数据使用类别判别,对多模态数据使用跨模态判别,以增补常规对比学习方法中所用的实例判别。我们进一步在共享表示空间上采用赢者通吃(WTA)哈希算法为未标记数据生成成对伪标签,以更好地预测簇分配。我们在大规模多模态视频基准Kinetics-400和VGG-Sound,以及图像基准CIFAR10、CIFAR100和ImageNet上对我们的框架进行了充分评估,取得了最先进(state-of-the-art)的结果。

关键词

引用

@article{arxiv.2104.12673,
  title  = {Joint Representation Learning and Novel Category Discovery on Single- and Multi-modal Data},
  author = {Xuhui Jia and Kai Han and Yukun Zhu and Bradley Green},
  journal= {arXiv preprint arXiv:2104.12673},
  year   = {2021}
}

备注

ICCV 2021