中文

基于内外语言知识蒸馏的视觉关系检测

计算机视觉与模式识别 2017-08-04 v2

摘要

理解视觉关系涉及识别主体、客体和关联二者的谓词。我们利用谓词与(主体,客体)对(在语义和空间上)的强相关性,以主体和客体为条件预测谓词。联合建模三个实体能更准确反映其关系,但也使学习复杂化,因为视觉关系的语义空间巨大且训练数据有限,尤其是对于实例很少的长尾关系。为克服此问题,我们使用语言统计知识来正则化视觉模型学习。我们通过从训练标注(内部知识)和公开可用文本(如维基百科,外部知识)中挖掘,计算给定(主体,客体)对的谓词条件概率分布。随后,我们将该知识蒸馏到深度模型中以实现更好的泛化。在视觉关系检测(VRD)和Visual Genome数据集上的实验结果表明,借助该语言知识蒸馏,我们的模型显著优于最先进(SOTA)方法,尤其在预测未见关系时(例如,在VRD零样本测试集上召回率从8.45%提升至19.17%)。

关键词

引用

@article{arxiv.1707.09423,
  title  = {Visual Relationship Detection with Internal and External Linguistic Knowledge Distillation},
  author = {Ruichi Yu and Ang Li and Vlad I. Morariu and Larry S. Davis},
  journal= {arXiv preprint arXiv:1707.09423},
  year   = {2017}
}

备注

ICCV 2017