中文

结合深度聚类引导优化的多尺度 Vision Transformer 弱监督目标定位

计算机视觉与模式识别 2023-12-18 v1 人工智能

摘要

本工作致力于弱监督目标定位任务。其目标是仅使用图像级类别标签来学习目标定位,这与边界框标注相比更容易获取。该任务非常重要,因为它减少了对费时费力的真实标注的需求。然而,使用弱监督训练的目标定位方法往往在定位精度上存在局限。为了应对这一挑战并提高定位精度,我们提出了一种多尺度目标定位 Transformer(MOLT)。它由多个目标定位 Transformer 组成,用于提取不同尺度的 patch 嵌入。此外,我们引入了一种深度聚类引导的优化方法,通过利用单独提取的图像分割区域进一步提高定位精度。这些分割区域是通过使用卷积神经网络对像素进行聚类获得的。最后,我们在公开的 ILSVRC-2012 数据集上进行了实验,证明了所提方法的有效性。

关键词

引用

@article{arxiv.2312.09584,
  title  = {Multiscale Vision Transformer With Deep Clustering-Guided Refinement for Weakly Supervised Object Localization},
  author = {David Kim and Sinhae Cha and Byeongkeun Kang},
  journal= {arXiv preprint arXiv:2312.09584},
  year   = {2023}
}

备注

5 pages