面向大词表的长尾视觉关系识别探索
计算机视觉与模式识别
2021-09-28 v7 机器学习
机器学习
摘要
近期文献中提出了若干缓解长尾问题的方法,主要集中于物体分类任务。本文首次针对长尾视觉关系识别(LTVRR)任务进行了大规模研究。LTVRR旨在改进对来自长尾的结构化视觉关系的学习(例如“兔子在草地上吃草”)。在此设定下,主体、关系和客体类别各自遵循长尾分布。为开展研究并为社区提供未来基准,我们引入了两个LTVRR相关基准,称为VG8K-LT和GQA-LT,构建于广泛使用的Visual Genome和GQA数据集之上。我们利用这些基准研究了若干最先进长尾模型在LTVRR设定下的性能。最后,我们提出了一种适应LTVRR设定的视觉语言无中心(VilHub)损失和一种Mixup增强技术,称为RelMix。VilHub和RelMix均可轻松集成到现有模型之上,尽管简单,我们的结果表明它们能显著提升性能,尤其在尾部类别上。基准、代码和模型已发布于:https://github.com/Vision-CAIR/LTVRR。
引用
@article{arxiv.2004.00436,
title = {Exploring Long Tail Visual Relationship Recognition with Large Vocabulary},
author = {Sherif Abdelkarim and Aniket Agarwal and Panos Achlioptas and Jun Chen and Jiaji Huang and Boyang Li and Kenneth Church and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2004.00436},
year = {2021}
}