基于语言先验与Softmax的视觉关系检测
计算机视觉与模式识别
2019-04-17 v1
摘要
视觉关系检测是一项中间层的图像理解任务,旨在检测图像中的两个对象并分类解释二者之间关系的谓词。这三个组成部分在语言与视觉上相互关联(例如“wear”与“person”和“shirt”相关,而“laptop”与“table”和“on”相关),因此由于之间存在多种可能情形,解空间十分巨大。本文利用了语言与视觉模块,并提出了一种精细的空间向量。本工作的模型在不依赖从大型文本语料库进行昂贵语言知识蒸馏以及构建复杂损失函数的情况下,超越了现有最优方法(state of the arts)。所有实验仅在Visual Relationship Detection和Visual Genome数据集上进行了评估。
引用
@article{arxiv.1904.07798,
title = {Visual Relationship Detection with Language prior and Softmax},
author = {Jaewon Jung and Jongyoul Park},
journal= {arXiv preprint arXiv:1904.07798},
year = {2019}
}
备注
6 pages, 4 figures