中文

Forest R-CNN:大词汇量长尾目标检测与实例分割

计算机视觉与模式识别 2021-03-04 v2

摘要

尽管目标分析此前已取得进展,但检测和分割具有长尾数据分布的大量目标类别仍是一个具有挑战性且较少被研究的问题。对于大词汇量分类器,获得含噪 logits 的概率要高得多,这容易导致错误识别。本文中,我们利用目标类别间关系的先验知识,将细粒度类别聚类为较粗的父类别,并构建一棵分类树,负责通过父类别将目标实例解析为细粒度类别。在分类树中,由于父类别节点数量显著更少,其 logits 噪声更小,可用于抑制细粒度类别节点中存在的错误/噪声 logits。由于构建父类别的方式并不唯一,我们进一步构建多棵树形成分类森林,每棵树为细粒度分类投出自己的一票。为缓解长尾现象引起的不平衡学习,我们提出一种简单而有效的重采样方法——NMS 重采样,以重新平衡数据分布。我们的方法称为 Forest R-CNN,可作为即插即用模块应用于大多数目标识别模型,以识别超过 1000 个类别。在大型词汇量数据集 LVIS 上进行了大量实验。与 Mask R-CNN 基线相比,Forest R-CNN 在稀有类别和总体类别上分别以 11.5% 和 3.9% 的 AP 提升显著提高了性能。此外,我们在 LVIS 数据集上取得了 SOTA 结果。代码见 https://github.com/JialianW/Forest_RCNN。

关键词

引用

@article{arxiv.2008.05676,
  title  = {Forest R-CNN: Large-Vocabulary Long-Tailed Object Detection and Instance Segmentation},
  author = {Jialian Wu and Liangchen Song and Tiancai Wang and Qian Zhang and Junsong Yuan},
  journal= {arXiv preprint arXiv:2008.05676},
  year   = {2021}
}

备注

Accepted to ACM MM 2020