面向场景图生成的细粒度谓词学习
计算机视觉与模式识别
2022-04-11 v2
摘要
当前场景图生成(SGG)模型的性能受到一些难以区分的谓词的严重制约,例如“woman-on/standing on/walking on-beach”或“woman-near/looking at/in front of-child”。通用 SGG 模型倾向于预测头部谓词,而现有的重平衡策略偏好尾部类别,它们均无法恰当处理这些难以区分的谓词。为解决此问题,受专注于区分难以区分的对象类别的细粒度图像分类启发,我们提出了一种名为细粒度谓词学习(FGPL)的方法,旨在为场景图生成任务区分难以区分的谓词。具体而言,我们首先引入一个谓词格,帮助 SGG 模型识别细粒度谓词对。然后,利用该谓词格,我们提出类别判别损失和实体判别损失,二者均有助于区分细粒度谓词,同时保持对已识别谓词的学习判别能力。所提出的与模型无关的策略在谓词分类子任务上分别以均值召回率(mR@100)显著提升三个基准模型(Transformer、VCTree 和 Motif)的性能 22.8%、24.1% 和 21.7%。我们的模型在 Visual Genome 数据集上也以较大优势超越最先进方法(即均值召回率(mR@100)提升 6.1%、4.6% 和 3.2%)。
引用
@article{arxiv.2204.02597,
title = {Fine-Grained Predicates Learning for Scene Graph Generation},
author = {Xinyu Lyu and Lianli Gao and Yuyu Guo and Zhou Zhao and Hao Huang and Heng Tao Shen and Jingkuan Song},
journal= {arXiv preprint arXiv:2204.02597},
year = {2022}
}