中文

面向大词表的长尾视觉关系识别探索

计算机视觉与模式识别 2021-09-28 v7 机器学习 机器学习

摘要

近期文献中提出了若干缓解长尾问题的方法,主要集中于物体分类任务。本文首次针对长尾视觉关系识别(LTVRR)任务进行了大规模研究。LTVRR旨在改进对来自长尾的结构化视觉关系的学习(例如“兔子在草地上吃草”)。在此设定下,主体、关系和客体类别各自遵循长尾分布。为开展研究并为社区提供未来基准,我们引入了两个LTVRR相关基准,称为VG8K-LT和GQA-LT,构建于广泛使用的Visual Genome和GQA数据集之上。我们利用这些基准研究了若干最先进长尾模型在LTVRR设定下的性能。最后,我们提出了一种适应LTVRR设定的视觉语言无中心(VilHub)损失和一种Mixup增强技术,称为RelMix。VilHub和RelMix均可轻松集成到现有模型之上,尽管简单,我们的结果表明它们能显著提升性能,尤其在尾部类别上。基准、代码和模型已发布于:https://github.com/Vision-CAIR/LTVRR。

关键词

引用

@article{arxiv.2004.00436,
  title  = {Exploring Long Tail Visual Relationship Recognition with Large Vocabulary},
  author = {Sherif Abdelkarim and Aniket Agarwal and Panos Achlioptas and Jun Chen and Jiaji Huang and Boyang Li and Kenneth Church and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2004.00436},
  year   = {2021}
}