在单块 GPU 上学习高效视觉关系检测器
计算机视觉与模式识别
2019-12-16 v1
摘要
我们介绍了在 Open Images 2019 视觉关系挑战赛中夺冠的方案。这是迄今为止同类中规模最大的挑战赛,拥有近 900 万张训练图像。挑战任务包括检测物体并识别复杂场景中物体间的关系。我们的方案分为三个阶段:首先使用一种新颖的权重迁移方法为挑战类别微调物体检测模型;然后,在候选物体对上训练空间-语义与视觉关系模型;最后,融合特征与模型预测以生成最终的关系预测。在整个挑战过程中,我们专注于最小化架构的硬件需求。具体而言,我们的权重迁移方法实现了远为快速的优化,使整个架构能在单块 GPU 上于两天内完成训练。除高效优化外,我们的方法还取得了优异精度,在超过 200 支队伍中夺得第一,并在留出的私有排行榜上以超过 的优势超越第二名。
引用
@article{arxiv.1912.06185,
title = {Learning Effective Visual Relationship Detector on 1 GPU},
author = {Yichao Lu and Cheng Chang and Himanshu Rai and Guangwei Yu and Maksims Volkovs},
journal= {arXiv preprint arXiv:1912.06185},
year = {2019}
}