中文

面向场景图生成的自适应细粒度谓词学习

计算机视觉与模式识别 2022-07-12 v1 人工智能

摘要

当前场景图生成(SGG)模型的性能受到难以区分的谓词的严重制约,例如 woman-on/standing on/walking on-beach。由于通用SGG模型倾向于预测头部谓词,而重平衡策略偏好尾部类别,它们均无法妥善处理难以区分的谓词。为解决此问题,受专注于区分难以区分对象的细粒度图像分类启发,我们提出一种自适应细粒度谓词学习(FGPL-A),旨在为SGG区分难以区分的谓词。首先,我们引入自适应谓词格(PL-A)以找出难以区分的谓词,其根据模型的动态学习节奏自适应地探索谓词关联。实际上,PL-A由SGG数据集初始化,并通过探索模型当前小批量(mini-batch)的预测得以精炼。利用PL-A,我们提出自适应类别判别损失(CDL-A)与自适应实体判别损失(EDL-A),它们依据模型动态学习状态提供细粒度监督,逐步规约模型的判别过程,确保平衡且高效的学习过程。大量实验结果表明,我们所提出的模型无关策略在VG-SGG与GQA-SGG数据集上以Mean Recall@100计将基准模型性能分别显著提升达175%与76%,取得了新的SOTA性能。此外,在句子到图检索(Sentence-to-Graph Retrieval)与图像描述(Image Captioning)任务上的实验进一步证明了本方法的实用性。

关键词

引用

@article{arxiv.2207.04602,
  title  = {Adaptive Fine-Grained Predicates Learning for Scene Graph Generation},
  author = {Xinyu Lyu and Lianli Gao and Pengpeng Zeng and Heng Tao Shen and Jingkuan Song},
  journal= {arXiv preprint arXiv:2207.04602},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2204.02597