中文

多目标拼接用于无监督表征学习

计算机视觉与模式识别 2025-06-10 v1 人工智能 机器学习

摘要

对单目标导向图像的对比式学习在无监督表征学习方面取得了显著进展,但在处理广泛存在的多目标图像时表现有限。本文提出一种简单而有效的方法,称为多目标拼接(Multiple Object Stitching, MOS),以细化多目标图像的无监督表征。具体而言,我们通过拼接单目标导向图像来构建多目标图像,其中合成的多目标图像中的目标是预先确定的。因此,与现有的对比方法相比,我们的方法在多目标图像之间提供了额外的目标对应关系,而无需人工标注。如此一来,我们的方法能够更关注多目标图像中每个目标的表征,从而为复杂的下游任务(如目标检测和语义分割)提供更详细的表征。在 ImageNet、CIFAR 和 COCO 数据集上的实验结果表明,我们提出的方法在单目标导向图像和多目标图像上均实现了领先的无监督表征性能。源代码已公开于 https://github.com/visresearch/MultipleObjectStitching。

关键词

引用

@article{arxiv.2506.07364,
  title  = {Multiple Object Stitching for Unsupervised Representation Learning},
  author = {Chengchao Shen and Dawei Liu and Jianxin Wang},
  journal= {arXiv preprint arXiv:2506.07364},
  year   = {2025}
}