中文

VL-LTR:面向长尾视觉识别的类级视觉-语言表示学习

计算机视觉与模式识别 2022-07-20 v4

摘要

基于深度学习的模型在处理现实世界中的长尾数据时面临挑战。现有的解决方案通常在图像模态的基础上采用一些平衡策略或迁移学习来处理类别不平衡问题。在这项工作中,我们提出了一个视觉-语言长尾识别框架,称为 VL-LTR,并对引入文本模态以促进长尾识别(LTR)的益处进行了实证研究。与现有方法相比,所提出的 VL-LTR 具有以下优点。(1)我们的方法不仅可以从图像中学习视觉表示,还可以从互联网上收集的带噪类级文本描述中学习相应的语言表示;(2)我们的方法能够有效利用学习到的视觉-语言表示来提升视觉识别性能,尤其是对于图像样本较少的类别。我们还进行了广泛的实验,并在广泛使用的 LTR 基准上取得了新的 SOTA 性能。值得注意的是,我们的方法在 ImageNet-LT 上实现了 77.2% 的总体准确率,显著优于此前最佳方法 17 个百分点以上,并且接近在完整 ImageNet 上训练的普遍性能。代码可在 https://github.com/ChangyaoTian/VL-LTR 获取。

关键词

引用

@article{arxiv.2111.13579,
  title  = {VL-LTR: Learning Class-wise Visual-Linguistic Representation for Long-Tailed Visual Recognition},
  author = {Changyao Tian and Wenhai Wang and Xizhou Zhu and Jifeng Dai and Yu Qiao},
  journal= {arXiv preprint arXiv:2111.13579},
  year   = {2022}
}

备注

Accepted by ECCV 2022; 14 pages, 9 figures